پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل Drama 3 از Fish Audio؛ کنترل دقیق صدای هوش مصنوعی با دستورات متنی

انتشار:۲ مهر ۱۴۰۵(۴ روز پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

شرکت Fish Audio نسخه پیش‌نمایش Drama 3 را منتشر کرد؛ مدل تبدیل متن به گفتاری که به توسعه‌دهندگان اجازه می‌دهد لحن و شخصیت صدا را با زبان طبیعی هدایت کنند.

مدل Drama 3 از Fish Audio؛ کنترل دقیق صدای هوش مصنوعی با دستورات متنی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل Drama 3 به جای استفاده از برچسب‌های ثابت، توصیفات متنی طبیعی را برای تغییر لحن، سرعت و شخصیت صدا درک می‌کند.
  • این مدل قابلیت تغییر صدا در میانه جمله و تولید مکالمات چندشخصیتی در یک درخواست واحد را بدون نیاز به برش صوتی فراهم می‌کند.
  • ویژگی اصلاح تک‌کلمه‌ای به توسعه‌دهندگان امکان می‌دهد تا کلمات با تلفظ اشتباه را بدون تغییر دادن کل فایل صوتی جایگزین کنند.

شرکت Fish Audio نسخه پیش‌نمایش محدودی از Drama 3 را منتشر کرده است؛ یک مدل تبدیل متن به گفتار (TTS) که توصیفات زبان طبیعی درباره لحن، سرعت و شخصیت را تفسیر می‌کند. به گفته Fish Audio، این مدل کنترل‌پذیرترین مدل تبدیل متن به گفتاری است که تاکنون عرضه کرده است.

این پیش‌نمایش سه قابلیت متمرکز بر تولید را معرفی می‌کند: تغییر صدا در میانه‌ی یک جمله، تولید چندین شخصیت در یک بار پردازش، و اصلاح یک کلمه با حفظ صدای پیرامون آن. این کنترل‌ها می‌توانند نیاز به تولید مجدد و برش‌های صوتی را برای پروژه‌های دیالوگ‌محور به میزان قابل‌توجهی کاهش دهند.

دستورات متنی صریح، کنترل دقیق‌تر

بسیاری از سیستم‌های بیانگر تبدیل متن به گفتار از نشانگرهای ثابتی مانند [whisper]، [laugh] یا (happy) استفاده می‌کنند. مدل Drama 3 توصیفات متنی اجرای مورد نظر را می‌پذیرد و به پرامپت‌ها این امکان را می‌دهد تا ویژگی‌های بیانی را ترکیب کنند که دایره واژگان برچسب‌های ثابت قادر به پوشش آن‌ها نیست.

قابلیت
تاثیر در تولید
تغییر صدا در میانه‌ی جمله
تغییر لحن، شخصیت یا انرژی در یک گفته واحد را ممکن می‌سازد و نیاز به برش زدن فایل‌های صوتی مجزا را کاهش می‌دهد.
صحنه‌های چند شخصیتی
یک مکالمه کامل را در یک مرحله پردازش تولید می‌کند و در عین حال تمایز گویندگان را در طول دیالوگ‌ها حفظ می‌کند.
اصلاح تک‌کلمه‌ای
کلمه‌ای که بد تلفظ شده یا اجرای ضعیفی داشته را جایگزین می‌کند، در حالی که صدای اطراف آن دست‌نخورده باقی می‌ماند.

فراخوانی API پیش‌نمایش

مدل Drama 3 از اندپوینت استاندارد تبدیل متن به گفتار Fish Audio استفاده می‌کند و از طریق هدر درخواست model انتخاب می‌شود. طبق مستندات API تبدیل متن به گفتار، drama-3-preview یک شناسه پیش‌نمایش است که رفتار و در دسترس بودن آن ممکن است تغییر کند. درخواست‌هایی که مقدار مدل در آن‌ها حذف شده یا ناشناخته باشد، به s2.1-pro بازمی‌گردند.

درخواست زیر مدل Drama 3 را انتخاب کرده و فایل MP3 تولیدشده را در یک فایل محلی ذخیره می‌کند:

curl --request POST \\
  --url https://api.fish.audio/v1/tts \\
  --header 'Authorization: Bearer <token>' \\
  --header 'Content-Type: application/json' \\
  --header 'model: drama-3-preview' \\
  --data '{
    \"text\": \"She paused, then whispered: it was you all along.\",
    \"format\": \"mp3\"
  }' \\
  --output take.mp3

ساختار منتشرشده این درخواست نشان‌دهنده نحوه انتخاب مدل است، اما Fish Audio هنوز دستور زبان رسمی برای هدایت زبان طبیعی Drama 3 منتشر نکرده است. همچنین مشخص نیست که آیا اصلاح تک‌کلمه‌ای از این اندپوینت، یک عملیات API مجزا یا رابط کاربری پیش‌نمایش استفاده می‌کند. توسعه‌دهندگانی که قصد دارند گردش‌های کاری ویرایشی خودکار ایجاد کنند، پیش از ادغام این ویژگی به این جزئیات نیاز دارند.

سازگاری مدل‌ها نیز بسته به حالت سنتز متفاوت است. تولید تک‌گوینده در تمامی مدل‌های سازگار تبدیل متن به گفتار کار می‌کند. دیالوگ‌های چندگوینده با s2-pro، s2.1-pro، s2.1-pro-free و drama-3-preview سازگار است؛ مدل قدیمی‌تر s1 فاقد این قابلیت است.

شرکت Fish Audio کلیدهای API پیش‌نمایش را از طریق درخواست در تاپیک معرفی خود توزیع کرده است، نه از طریق یک تنظیمات عمومی و خودکار. همچنین قیمت‌گذاری پیش‌نمایش هنوز منتشر نشده و هزینه‌های تولید و محدودیت‌های استفاده نامشخص باقی مانده است.

توکن‌های گوینده در لایه‌های زیرین

مدل Drama 3 بر پایه کارهای چندگوینده خانواده S2 ساخته شده است. بر اساس مستندات منتشرشده، S2 می‌تواند صدای مرجع حاوی چندین صدا را پردازش کند و هر گوینده را با یک توکن گوینده نشان دهد. سپس یک اسکریپت می‌تواند از شناسه‌های گوینده برای تخصیص دیالوگ در یک پردازش استفاده کند.

توکن‌های گوینده به عنوان شناسه‌های صدای قابل استفاده مجدد در بستر مدل عمل می‌کنند. آن‌ها به یک درخواست اجازه می‌دهند تا هویت‌های جداگانه شخصیت‌ها را در چندین دیالوگ حفظ کند و نیاز به سنتز جداگانه هر گوینده و مونتاژ صحنه در مرحله بعد را از بین می‌برد.

بر اساس گزارش‌های منتشرشده، این پیش‌نمایش قابلیت شبیه‌سازی صدای مدل S2 را نیز حفظ کرده است. این گردش کار، رنگ صدا، سبک صحبت کردن و تمایلات احساسی را از کلیپ‌های مرجعی که حدود ۱۰ تا ۳۰ ثانیه طول می‌کشند، بدون نیاز به تنظیم دقیق اضافی استخراج می‌کند. Drama 3 هدایت اجرای خط به خط را به صدای شبیه‌سازی‌شده اضافه می‌کند.

کاهش هزینه‌های ویرایش

تولید دیالوگ و تولید صدای محلی‌سازی‌شده روشن‌ترین موارد استفاده هستند زیرا هر دو به شخصیت‌های سازگار، تحویل متنوع و بازنگری‌های مکرر نیاز دارند:

  • درام‌های کوتاه، انیمیشن‌ها و بازی‌هایی با چندین شخصیت در هر صحنه.
  • کتاب‌های صوتی که صداها و احساسات را در یک پاراگراف تغییر می‌دهند.
  • صداگذاری پادکست‌ها و ویدیوهایی که در مراحل پایانی دچار تغییر متن می‌شوند.
  • خطوط لوله محلی‌سازی و دوبله که از صداهای شخصیت‌ها در صحنه‌های مختلف استفاده مجدد می‌کنند.

اصلاح تک‌کلمه‌ای ممکن است بیشترین صرفه‌جویی فوری را در گردش کار ایجاد کند. یک نام با تلفظ اشتباه می‌تواند کلیپی که در غیر این صورت قابل استفاده بود را خراب کند، و تولید مجدد کامل اغلب زمان‌بندی، تاکید یا ریتم را در جاهای دیگر تغییر می‌دهد. جایگزینی محلی، اجرای پذیرفته‌شده را حفظ کرده و ویرایش‌های بعدی را محدود می‌کند.

نواقص مهم در نسخه پیش‌نمایش

شرکت Fish Audio مدل Drama 3 را به عنوان یک پیش‌نمایش معرفی کرده و هشدار می‌دهد که رفتار و در دسترس بودن آن ممکن است تغییر کند. این شرکت هنوز هیچ بنچمارک، اندازه‌گیری تأخیر، قیمت‌گذاری یا مقایسه رسمی با سیستم‌هایی مانند ElevenLabs v3 و مدل‌های صوتی OpenAI منتشر نکرده است.

هدایت با زبان طبیعی همچنین سوالاتی در مورد تکرارپذیری ایجاد می‌کند. دستوراتی مانند «طعنه‌آمیز و عصبی» فضایی برای تفسیر باقی می‌گذارند، بنابراین تولیدهای مکرر ممکن است حتی زمانی که کلمات ثابت می‌مانند، متفاوت باشند. ارزیابی تولید باید ثبات در صداها، فیلم‌نامه‌ها، زبان‌ها و اجراهای مکرر را اندازه‌گیری کند.

تولید چندگوینده نیز به آزمایش‌های مشابهی در مورد نشت گوینده، تخصیص نوبت، ثبات در صحنه‌های طولانی و تأخیر نیاز دارد. نتایج رسمی برای این موارد هنوز منتشر نشده است که این پیش‌نمایش را بیشتر برای ارزیابی مناسب می‌سازد تا وابستگی‌های روبه‌مشتری با الزامات سخت‌گیرانه قابلیت اطمینان.

تبدیل رابط‌های صوتی به پرامپت

مدل Drama 3 پیرو تغییر گسترده‌تری در سنتز گفتار از کنترل‌های ثابت به سمت مدل‌های پیروی‌کننده از دستورالعمل است. رویکرد فنی اصلی آن این است که هدایت آزاد می‌تواند ترکیباتی از لحن، شخصیت و سرعت را پوشش دهد که برچسب‌های از پیش‌تعریف‌شده نمی‌توانند برشمارند. ارزش عملی این پیش‌نمایش بستگی به این دارد که این دستورالعمل‌ها با چه میزان قابلیت اطمینان در برداشت‌های مختلف بازتولید شوند و آیا Fish Audio امکاناتی برای اصلاح، کنترل گوینده و پرامپت‌نویسی از طریق APIهای پایدار ارائه خواهد داد یا خیر.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر