پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ترکیب جادویی گویندگی و موسیقی متن فقط با یک پرامپت؛ قابلیت جذاب Suno Speech از راه رسید!

انتشار:۱۰ مهر ۱۴۰۵(۵۷ دقیقه پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ محبوب سونو با معرفی قابلیت آزمایشی Speech، گام هیجان‌انگیز دیگری در دنیای صوت برداشته است. این مدل هوش مصنوعی می‌تواند متن شما را تحویل بگیرد و هم‌زمان نریشن را همراه با موسیقی متنی هماهنگ در قالب یک قطعه صوتی یکپارچه بسازد. با این نوآوری، دردسرهای میکس و ادیت دستی صدا برای تولیدکنندگان محتوا به حداقل خواهد رسید.

ترکیب جادویی گویندگی و موسیقی متن فقط با یک پرامپت؛ قابلیت جذاب Suno Speech از راه رسید!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ سونو (Suno) از نسخه بتای قابلیتی به نام Speech رونمایی کرد که نریشن و موسیقی متن پس‌زمینه را به‌صورت کاملاً هماهنگ و در قالب یک ترک صوتی یکپارچه تولید می‌کند.
  • برخلاف روش‌های سنتی که اول صدا ضبط می‌شود و بعد باید دستی موزیک روی آن چیده شود، این مدل مکث‌های کلامی، لحن گوینده و افت‌وخیزهای موسیقی را از همان اول با هم کوک می‌کند.
  • این ابزار جالب فعلاً در اپلیکیشن اصلی سونو در دسترس قرار گرفته، اما هنوز خبری از API رسمی نیست و در برخی لهجه‌ها و تنظیم طول مکث‌ها باگ‌هایی دارد.

تولید هم‌زمان نریشن و موسیقی متن با Suno Speech

شرکت سونو بتای عمومی قابلیت Speech را در دسترس کاربران قرار داده است؛ یک مدل هوش مصنوعی تبدیل متن به صوت که نریشن و موسیقی متن اورجینال را در قالب یک ترک صوتی پیوسته خلق می‌کند. کاربران فقط کافی است متن خود را بنویسند، جنس و ویژگی‌های صدا را توصیف کنند و سبک و حس‌وحال موسیقی مدنظرشان را تعیین کنند.

سونو قابلیت Speech را نخستین مدلی می‌داند که گویندگی و موسیقی متناسب با آن را تنها در یک مرحله تولید می‌کند. با این معماری، لحن خوانش، مکث‌ها، ریتم و نشانه‌های دراماتیک موسیقی هم‌گام با یکدیگر شکل می‌گیرند و دیگر نیازی به سینک کردن دستی و طاقت‌فرسای فایل‌های صوتی حاصل از ابزار‌های جداگانه نیست.

وضعیت
بتای عمومی (Open beta)
نحوه دسترسی
اپلیکیشن اصلی سونو (Suno)
ورودی‌ها
متن خوانش، توصیف صدا و سبک موسیقی
خروجی
یک فایل صوتی پیوسته شامل نریشن و موسیقی متن اورجینال
قیمت‌گذاری
استفاده بر اساس بسته‌های اعتباری فعلی سونو (بدون تعرفه مجزا)
دسترسی توسعه‌دهندگان
فعلاً هیچ API، SDK یا دسترسی برنامه‌نویسی معرفی نشده است

ساخت یک قطعه صوتی همراه با موسیقی در سه مرحله ساده

  1. متن مورد نظر برای خوانش را وارد کنید؛ متنی مثل یک شعر، پیام تبریک اختصاصی، داستان یا یک پیام معمولی.
  2. ویژگی‌های صدا را توصیف کنید؛ مواردی مانند لهجه، دوره تاریخی، لحن یا تنالیته و زیروبمی صدا.
  3. موسیقی پس‌زمینه را پرامپت‌نویسی کنید و ژانر، حال‌وهوا یا روند دراماتیک آن را شرح دهید.

گردش کار این بخش کاملاً شبیه فرایند ساخت موزیک در اپلیکیشن سونو است. این شرکت پیش از انتشار عمومی بتای Speech، آن را به مدت یک ماه در یک گروه کاربری محدودتر آزمایش کرده بود.

دموهای منتشرشده توسط سونو حسابی بامزه و جالب‌توجه است؛ از جمله خوانش بخشی از کتاب ادیسه هومر که به زبان عامیانه و اصطلاحات نسل زد (Gen Z) بازنویسی شده، یا درخواست شستن ظرف‌ها از هم‌اتاقی با انگلیسی فاخر دوران ویکتوریا! نکته کلیدی در همه این نمونه‌ها این است که ملودی و ریتم موزیک، پا‌به‌پای تغییرات لحن و فراز و فرود دراماتیک متن حرکت می‌کند.

برگ برنده: زمان‌بندی بی‌نقص و هماهنگ

در روش‌های سنتی تولید پادکست و نریشن، ابتدا باید متن را با ابزار‌های تبدیل متن به گفتار (TTS) ضبط کنید و سپس فایل خروجی را به یک نرم‌افزار حرفه‌ای تدوین صدا (DAW) ببرید. در ادامه ادیتورها باید وقت زیادی بگذارند تا داکینگ صدا (کاهش صدای موسیقی هنگام صحبت گوینده)، مکث‌ها، ضرب‌آهنگ، ترنزیشن‌ها و اوج‌گیری‌های احساسی را به شکل دستی تنظیم کنند.

مدل Speech سونو تمام این قطعات پازل را هم‌زمان خلق می‌کند. مکث راوی می‌تواند دقیقاً روی یک ترنزیشن یا پرده موسیقی بنشیند و اوج گرفتن هیجان در صدای گوینده، با اوج‌گیری ملودی یا یک ضرب ریتمیک هماهنگ شود. این هماهنگی بی‌دردسر می‌تواند حجم کار‌های ادیت و تدوین را برای پروژه‌های کوتاه صوتی به‌شدت کاهش دهد.

کاربردهای اصلی نسخه بتا کجاست؟

  • روایت‌های نمایشی و دراماتیک: خوانش شعرها، متون مذهبی و باستانی، سخنرانی‌ها، قصه‌های شب و پیام‌های تبریک مجالس.
  • پیام‌های صوتی با موزیک اختصاصی: ارسال وویس‌ها و پیام‌های شخصی‌سازی‌شده همراه با پس‌زمینه‌ای که با حس‌وحال حرف‌های شما کوک شده است.
  • شخصیت‌پردازی‌های صوتی: خلق لهجه‌ها و سبک‌های خوانش متعلق به دوره‌های زمانی خاص همراه با موسیقی متناسب با آن سبک.
  • فایل‌های صوتی راهنما: محتواهای مدیتیشن، جملات انگیزشی و سایر فرمت‌های کلامی که معمولاً نیازمند موسیقی آرامش‌بخش یا روحیه‌بخش پس‌زمینه هستند.
  • محتوای کوتاه شبکه‌های اجتماعی: کلیپ‌های ویدیویی روایت‌محور و استوری‌هایی که حساسیت میلی‌ثانیه‌ای روی زمان‌بندی دقیق ندارند.

نقاط ضعف و چالش‌های فعلی نسخه بتا

البته سونو هشدار داده که نسخه بتای Speech هنوز بی‌نقص نیست و پایداری کاملی ندارد. برای مثال، لهجه گوینده ممکن است در طول خوانش تغییر کند؛ مثلاً یک صدای بریتانیایی کم‌کم به سمت تلفظ استرالیایی متمایل شود! همچنین گاهی اوقات مکث‌ها طولانی‌تر از دستور کاربر می‌شوند و اگر یک پرامپت را چند بار اجرا کنید، ممکن است سرعت خوانش و لحن در هر بار خروجی متفاوتی داشته باشد.

در این نسخه آزمایشی هنوز خبری از تنظیمات دقیق برای تعیین زمان‌بندی ثانیه‌ای، کنترل کلمه‌به‌کلمه، جانمایی دستی نشانه‌های موسیقی یا شبیه‌سازی صدای اشخاص بر اساس یک فایل ضبط‌شده مرجع نیست. علاوه بر این، سونو هنوز اطلاعات فنی چندانی درباره تأخیر پردازش (Latency)، فرمت‌های خروجی، محدودیت‌های مصرف یا تضمین‌های پایداری برای مصارف تجاری ارائه نکرده است.

از Bark تا Speech؛ مسیر سونو در حوزه صوت

معرفی Speech گام بلند سونو برای گسترش قلمرو خود فراتر از صرفاً تولید موسیقی است. این استارتاپ در سال ۲۰۲۳ و قبل از اینکه تمام تمرکزش را روی ترانه‌سازی بگذارد، مدل صوتی متن‌باز Bark را منتشر کرده بود. حالا سونو تجربیات ارزشمند قبلی خود در پردازش گفتار را با موتور قدرتمند ساخت موسیقی‌اش ترکیب کرده تا یک محصول یکپارچه ارائه دهد.

سونو علاوه بر این، ابزار مجزایی به نام Voices هم دارد که با دریافت یک نمونه صدای ۱۵ ثانیه تا ۴ دقیقه‌ای، امکان استفاده مجدد از آن صدا را در تولیدات بعدی فراهم می‌کند؛ البته با یک عبارت تأیید صوتی هوشمندانه تا جلوی کلون کردن و سوءاستفاده‌های غیرمجاز از صدای دیگران گرفته شود. این شرکت به‌تازگی مدل پرچمدار خود یعنی Suno v6 را نیز برای ساخت حرفه‌ای موسیقی در دسترس قرار داده است.

فاصله بین ابزار‌های گفتار و هوش مصنوعی موسیقی

در حال حاضر پلتفرم‌های پیشرو مانند ElevenLabs و OpenAI روی صداپیشگی و شبیه‌سازی دقیق کلام تمرکز دارند، درحالی‌که سرویس‌هایی مثل Suno، Udio و ابزار‌های برگرفته از Riffusion پادشاهان حوزه تولید موسیقی هستند. تقریباً تمام خطوط تولید رسانه‌ای این دو لایه را جداگانه می‌سازند. هدف Suno Speech پر کردن همین خلأ در قطعات کوتاه روایتی است تا موسیقی و کلام از همان ثانیه اول در کنار هم متولد شوند.

چنین قابلیتی پتانسیل فوق‌العاده‌ای برای اپلیکیشن‌های قصه‌گویی، پلتفرم‌های مدیتیشن و سلامت روان، پیام‌های صوتی شخصی‌سازی‌شده، بازی‌های ویدیویی و ابزار‌های ادیت ویدیوهای کوتاه دارد؛ گرچه در حال حاضر دسترسی به آن تنها محدود به محیط اپلیکیشن سونو بوده و هنوز ابزار‌های دقیق برای تنظیم زمان‌بندی ارائه نشده است.

قطعه گمشده پازل برای توسعه‌دهندگان

سونو هنوز هیچ رابط برنامه‌نویسی کاربردی (API) برای مدل Speech معرفی نکرده است. در نتیجه برنامه‌نویسان و استارتاپ‌ها فعلاً نمی‌توانند به شکل خودکار متن‌هایشان را برای مدل ارسال کنند، پارامترهای ساختاریافته دریافت نمایند یا این قابلیت جذاب را به پایپ‌لاین تولید محتوای خود بیفزایند.

برای عرضه یک نسخه تجاری آماده برای محیط‌های عملیاتی، سونو باید مستنداتی پیرامون نحوه احراز هویت، تعرفه‌ها، سهمیه‌ها، تأخیر زمانی، فرمت‌های فایلی، قوانین کپی‌رایت و پایداری نسخه‌ها منتشر کند. تا زمان ارائه این جزئیات، مدل Speech یک بتای هیجان‌انگیز برای کاربران عادی و نمایشی جذاب از آینده تولید محتوای صوتی بدون دردسر به حساب می‌آید.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

هشدار جنجالی پاپ لئو درباره هوش مصنوعی: «ماشین‌ها فاقد جرقه انسانیت هستند؛ هنرمندان باید متحد شوند!»
آخرین اخبار

هشدار جنجالی پاپ لئو درباره هوش مصنوعی: «ماشین‌ها فاقد جرقه انسانیت هستند؛ هنرمندان باید متحد شوند!»

پاپ لئو چهاردهم با هشدار جدی درباره خطر هوش مصنوعی برای خلاقیت بشری، از هنرمندان خواست برای دفاع از هویت انسانی با کلیسا متحد شوند. او معتقد است خروجی الگوریتم‌ها صرفاً حاصل محاسبات آماری است و هرگز به «جرقه انسانیت» دست پیدا نخواهد کرد.

۲ دقیقه مطالعه
۰
۱۰ مهر
وام نجومی ۶۰ میلیارد دلاری برودکام برای تأمین تراشه‌های هوش مصنوعی آنتروپیک
آخرین اخبار

وام نجومی ۶۰ میلیارد دلاری برودکام برای تأمین تراشه‌های هوش مصنوعی آنتروپیک

شرکت برودکام برای تأمین تراشه‌ها و زیرساخت‌های محاسباتی هوش مصنوعی، به‌ویژه برای استارتاپ آنتروپیک، در حال جمع‌آوری بسته وامی نجومی به ارزش ۶۰ میلیارد دلار است. این توافق مالی بزرگ نشان‌دهنده تداوم عطش سرمایه‌گذاران برای توسعه دیتاسنترهای هوش مصنوعی است، هرچند وابستگی شدید آنتروپیک به برودکام نگرانی‌هایی درباره تضاد منافع ایجاد کرده است.

۲ دقیقه مطالعه
۰
۱۰ مهر
نقشه کامل جنگ هوش مصنوعی در آمریکا؛ فرمانداران ایالت‌ها درباره دیتاسنترها و «دکمه مرگ» چه می‌گویند؟
آخرین اخبار

نقشه کامل جنگ هوش مصنوعی در آمریکا؛ فرمانداران ایالت‌ها درباره دیتاسنترها و «دکمه مرگ» چه می‌گویند؟

هم‌زمان با نزدیک‌شدن به انتخابات در آمریکا، تب‌وتاب هوش مصنوعی و زیرساخت‌های غول‌پیکر آن به یکی از داغ‌ترین میدان‌های رقابت سیاسی تبدیل شده است. در حالی که برخی فرمانداران به دنبال ساخت دیتاسنترهای چند میلیارد دلاری برای جذب غول‌های فناوری هستند، گروهی دیگر روی طراحی «دکمه مرگ» اضطراری و کنترل خطرات جدی هوش مصنوعی تمرکز کرده‌اند. این گزارش نگاهی جامع به موضع تمام فرمانداران آمریکا در قبال آینده هوش مصنوعی و مصرف انرژی مراکز داده دارد.

۳۱ دقیقه مطالعه
۰
۱۰ مهر