ترکیب جادویی گویندگی و موسیقی متن فقط با یک پرامپت؛ قابلیت جذاب Suno Speech از راه رسید!
استارتاپ محبوب سونو با معرفی قابلیت آزمایشی Speech، گام هیجانانگیز دیگری در دنیای صوت برداشته است. این مدل هوش مصنوعی میتواند متن شما را تحویل بگیرد و همزمان نریشن را همراه با موسیقی متنی هماهنگ در قالب یک قطعه صوتی یکپارچه بسازد. با این نوآوری، دردسرهای میکس و ادیت دستی صدا برای تولیدکنندگان محتوا به حداقل خواهد رسید.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ سونو (Suno) از نسخه بتای قابلیتی به نام Speech رونمایی کرد که نریشن و موسیقی متن پسزمینه را بهصورت کاملاً هماهنگ و در قالب یک ترک صوتی یکپارچه تولید میکند.
- برخلاف روشهای سنتی که اول صدا ضبط میشود و بعد باید دستی موزیک روی آن چیده شود، این مدل مکثهای کلامی، لحن گوینده و افتوخیزهای موسیقی را از همان اول با هم کوک میکند.
- این ابزار جالب فعلاً در اپلیکیشن اصلی سونو در دسترس قرار گرفته، اما هنوز خبری از API رسمی نیست و در برخی لهجهها و تنظیم طول مکثها باگهایی دارد.
تولید همزمان نریشن و موسیقی متن با Suno Speech
شرکت سونو بتای عمومی قابلیت Speech را در دسترس کاربران قرار داده است؛ یک مدل هوش مصنوعی تبدیل متن به صوت که نریشن و موسیقی متن اورجینال را در قالب یک ترک صوتی پیوسته خلق میکند. کاربران فقط کافی است متن خود را بنویسند، جنس و ویژگیهای صدا را توصیف کنند و سبک و حسوحال موسیقی مدنظرشان را تعیین کنند.
سونو قابلیت Speech را نخستین مدلی میداند که گویندگی و موسیقی متناسب با آن را تنها در یک مرحله تولید میکند. با این معماری، لحن خوانش، مکثها، ریتم و نشانههای دراماتیک موسیقی همگام با یکدیگر شکل میگیرند و دیگر نیازی به سینک کردن دستی و طاقتفرسای فایلهای صوتی حاصل از ابزارهای جداگانه نیست.
وضعیت | بتای عمومی (Open beta) |
|---|---|
نحوه دسترسی | اپلیکیشن اصلی سونو (Suno) |
ورودیها | متن خوانش، توصیف صدا و سبک موسیقی |
خروجی | یک فایل صوتی پیوسته شامل نریشن و موسیقی متن اورجینال |
قیمتگذاری | استفاده بر اساس بستههای اعتباری فعلی سونو (بدون تعرفه مجزا) |
دسترسی توسعهدهندگان | فعلاً هیچ API، SDK یا دسترسی برنامهنویسی معرفی نشده است |
ساخت یک قطعه صوتی همراه با موسیقی در سه مرحله ساده
- متن مورد نظر برای خوانش را وارد کنید؛ متنی مثل یک شعر، پیام تبریک اختصاصی، داستان یا یک پیام معمولی.
- ویژگیهای صدا را توصیف کنید؛ مواردی مانند لهجه، دوره تاریخی، لحن یا تنالیته و زیروبمی صدا.
- موسیقی پسزمینه را پرامپتنویسی کنید و ژانر، حالوهوا یا روند دراماتیک آن را شرح دهید.
گردش کار این بخش کاملاً شبیه فرایند ساخت موزیک در اپلیکیشن سونو است. این شرکت پیش از انتشار عمومی بتای Speech، آن را به مدت یک ماه در یک گروه کاربری محدودتر آزمایش کرده بود.
دموهای منتشرشده توسط سونو حسابی بامزه و جالبتوجه است؛ از جمله خوانش بخشی از کتاب ادیسه هومر که به زبان عامیانه و اصطلاحات نسل زد (Gen Z) بازنویسی شده، یا درخواست شستن ظرفها از هماتاقی با انگلیسی فاخر دوران ویکتوریا! نکته کلیدی در همه این نمونهها این است که ملودی و ریتم موزیک، پابهپای تغییرات لحن و فراز و فرود دراماتیک متن حرکت میکند.
برگ برنده: زمانبندی بینقص و هماهنگ
در روشهای سنتی تولید پادکست و نریشن، ابتدا باید متن را با ابزارهای تبدیل متن به گفتار (TTS) ضبط کنید و سپس فایل خروجی را به یک نرمافزار حرفهای تدوین صدا (DAW) ببرید. در ادامه ادیتورها باید وقت زیادی بگذارند تا داکینگ صدا (کاهش صدای موسیقی هنگام صحبت گوینده)، مکثها، ضربآهنگ، ترنزیشنها و اوجگیریهای احساسی را به شکل دستی تنظیم کنند.
مدل Speech سونو تمام این قطعات پازل را همزمان خلق میکند. مکث راوی میتواند دقیقاً روی یک ترنزیشن یا پرده موسیقی بنشیند و اوج گرفتن هیجان در صدای گوینده، با اوجگیری ملودی یا یک ضرب ریتمیک هماهنگ شود. این هماهنگی بیدردسر میتواند حجم کارهای ادیت و تدوین را برای پروژههای کوتاه صوتی بهشدت کاهش دهد.
کاربردهای اصلی نسخه بتا کجاست؟
- روایتهای نمایشی و دراماتیک: خوانش شعرها، متون مذهبی و باستانی، سخنرانیها، قصههای شب و پیامهای تبریک مجالس.
- پیامهای صوتی با موزیک اختصاصی: ارسال وویسها و پیامهای شخصیسازیشده همراه با پسزمینهای که با حسوحال حرفهای شما کوک شده است.
- شخصیتپردازیهای صوتی: خلق لهجهها و سبکهای خوانش متعلق به دورههای زمانی خاص همراه با موسیقی متناسب با آن سبک.
- فایلهای صوتی راهنما: محتواهای مدیتیشن، جملات انگیزشی و سایر فرمتهای کلامی که معمولاً نیازمند موسیقی آرامشبخش یا روحیهبخش پسزمینه هستند.
- محتوای کوتاه شبکههای اجتماعی: کلیپهای ویدیویی روایتمحور و استوریهایی که حساسیت میلیثانیهای روی زمانبندی دقیق ندارند.
نقاط ضعف و چالشهای فعلی نسخه بتا
البته سونو هشدار داده که نسخه بتای Speech هنوز بینقص نیست و پایداری کاملی ندارد. برای مثال، لهجه گوینده ممکن است در طول خوانش تغییر کند؛ مثلاً یک صدای بریتانیایی کمکم به سمت تلفظ استرالیایی متمایل شود! همچنین گاهی اوقات مکثها طولانیتر از دستور کاربر میشوند و اگر یک پرامپت را چند بار اجرا کنید، ممکن است سرعت خوانش و لحن در هر بار خروجی متفاوتی داشته باشد.
در این نسخه آزمایشی هنوز خبری از تنظیمات دقیق برای تعیین زمانبندی ثانیهای، کنترل کلمهبهکلمه، جانمایی دستی نشانههای موسیقی یا شبیهسازی صدای اشخاص بر اساس یک فایل ضبطشده مرجع نیست. علاوه بر این، سونو هنوز اطلاعات فنی چندانی درباره تأخیر پردازش (Latency)، فرمتهای خروجی، محدودیتهای مصرف یا تضمینهای پایداری برای مصارف تجاری ارائه نکرده است.
از Bark تا Speech؛ مسیر سونو در حوزه صوت
معرفی Speech گام بلند سونو برای گسترش قلمرو خود فراتر از صرفاً تولید موسیقی است. این استارتاپ در سال ۲۰۲۳ و قبل از اینکه تمام تمرکزش را روی ترانهسازی بگذارد، مدل صوتی متنباز Bark را منتشر کرده بود. حالا سونو تجربیات ارزشمند قبلی خود در پردازش گفتار را با موتور قدرتمند ساخت موسیقیاش ترکیب کرده تا یک محصول یکپارچه ارائه دهد.
سونو علاوه بر این، ابزار مجزایی به نام Voices هم دارد که با دریافت یک نمونه صدای ۱۵ ثانیه تا ۴ دقیقهای، امکان استفاده مجدد از آن صدا را در تولیدات بعدی فراهم میکند؛ البته با یک عبارت تأیید صوتی هوشمندانه تا جلوی کلون کردن و سوءاستفادههای غیرمجاز از صدای دیگران گرفته شود. این شرکت بهتازگی مدل پرچمدار خود یعنی Suno v6 را نیز برای ساخت حرفهای موسیقی در دسترس قرار داده است.
فاصله بین ابزارهای گفتار و هوش مصنوعی موسیقی
در حال حاضر پلتفرمهای پیشرو مانند ElevenLabs و OpenAI روی صداپیشگی و شبیهسازی دقیق کلام تمرکز دارند، درحالیکه سرویسهایی مثل Suno، Udio و ابزارهای برگرفته از Riffusion پادشاهان حوزه تولید موسیقی هستند. تقریباً تمام خطوط تولید رسانهای این دو لایه را جداگانه میسازند. هدف Suno Speech پر کردن همین خلأ در قطعات کوتاه روایتی است تا موسیقی و کلام از همان ثانیه اول در کنار هم متولد شوند.
چنین قابلیتی پتانسیل فوقالعادهای برای اپلیکیشنهای قصهگویی، پلتفرمهای مدیتیشن و سلامت روان، پیامهای صوتی شخصیسازیشده، بازیهای ویدیویی و ابزارهای ادیت ویدیوهای کوتاه دارد؛ گرچه در حال حاضر دسترسی به آن تنها محدود به محیط اپلیکیشن سونو بوده و هنوز ابزارهای دقیق برای تنظیم زمانبندی ارائه نشده است.
قطعه گمشده پازل برای توسعهدهندگان
سونو هنوز هیچ رابط برنامهنویسی کاربردی (API) برای مدل Speech معرفی نکرده است. در نتیجه برنامهنویسان و استارتاپها فعلاً نمیتوانند به شکل خودکار متنهایشان را برای مدل ارسال کنند، پارامترهای ساختاریافته دریافت نمایند یا این قابلیت جذاب را به پایپلاین تولید محتوای خود بیفزایند.
برای عرضه یک نسخه تجاری آماده برای محیطهای عملیاتی، سونو باید مستنداتی پیرامون نحوه احراز هویت، تعرفهها، سهمیهها، تأخیر زمانی، فرمتهای فایلی، قوانین کپیرایت و پایداری نسخهها منتشر کند. تا زمان ارائه این جزئیات، مدل Speech یک بتای هیجانانگیز برای کاربران عادی و نمایشی جذاب از آینده تولید محتوای صوتی بدون دردسر به حساب میآید.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

هشدار جنجالی پاپ لئو درباره هوش مصنوعی: «ماشینها فاقد جرقه انسانیت هستند؛ هنرمندان باید متحد شوند!»
پاپ لئو چهاردهم با هشدار جدی درباره خطر هوش مصنوعی برای خلاقیت بشری، از هنرمندان خواست برای دفاع از هویت انسانی با کلیسا متحد شوند. او معتقد است خروجی الگوریتمها صرفاً حاصل محاسبات آماری است و هرگز به «جرقه انسانیت» دست پیدا نخواهد کرد.

وام نجومی ۶۰ میلیارد دلاری برودکام برای تأمین تراشههای هوش مصنوعی آنتروپیک
شرکت برودکام برای تأمین تراشهها و زیرساختهای محاسباتی هوش مصنوعی، بهویژه برای استارتاپ آنتروپیک، در حال جمعآوری بسته وامی نجومی به ارزش ۶۰ میلیارد دلار است. این توافق مالی بزرگ نشاندهنده تداوم عطش سرمایهگذاران برای توسعه دیتاسنترهای هوش مصنوعی است، هرچند وابستگی شدید آنتروپیک به برودکام نگرانیهایی درباره تضاد منافع ایجاد کرده است.

نقشه کامل جنگ هوش مصنوعی در آمریکا؛ فرمانداران ایالتها درباره دیتاسنترها و «دکمه مرگ» چه میگویند؟
همزمان با نزدیکشدن به انتخابات در آمریکا، تبوتاب هوش مصنوعی و زیرساختهای غولپیکر آن به یکی از داغترین میدانهای رقابت سیاسی تبدیل شده است. در حالی که برخی فرمانداران به دنبال ساخت دیتاسنترهای چند میلیارد دلاری برای جذب غولهای فناوری هستند، گروهی دیگر روی طراحی «دکمه مرگ» اضطراری و کنترل خطرات جدی هوش مصنوعی تمرکز کردهاند. این گزارش نگاهی جامع به موضع تمام فرمانداران آمریکا در قبال آینده هوش مصنوعی و مصرف انرژی مراکز داده دارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.