مدل Drama 3 از Fish Audio؛ کنترل دقیق صدای هوش مصنوعی با دستورات متنی
شرکت Fish Audio نسخه پیشنمایش Drama 3 را منتشر کرد؛ مدل تبدیل متن به گفتاری که به توسعهدهندگان اجازه میدهد لحن و شخصیت صدا را با زبان طبیعی هدایت کنند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل Drama 3 به جای استفاده از برچسبهای ثابت، توصیفات متنی طبیعی را برای تغییر لحن، سرعت و شخصیت صدا درک میکند.
- این مدل قابلیت تغییر صدا در میانه جمله و تولید مکالمات چندشخصیتی در یک درخواست واحد را بدون نیاز به برش صوتی فراهم میکند.
- ویژگی اصلاح تککلمهای به توسعهدهندگان امکان میدهد تا کلمات با تلفظ اشتباه را بدون تغییر دادن کل فایل صوتی جایگزین کنند.
شرکت Fish Audio نسخه پیشنمایش محدودی از Drama 3 را منتشر کرده است؛ یک مدل تبدیل متن به گفتار (TTS) که توصیفات زبان طبیعی درباره لحن، سرعت و شخصیت را تفسیر میکند. به گفته Fish Audio، این مدل کنترلپذیرترین مدل تبدیل متن به گفتاری است که تاکنون عرضه کرده است.
این پیشنمایش سه قابلیت متمرکز بر تولید را معرفی میکند: تغییر صدا در میانهی یک جمله، تولید چندین شخصیت در یک بار پردازش، و اصلاح یک کلمه با حفظ صدای پیرامون آن. این کنترلها میتوانند نیاز به تولید مجدد و برشهای صوتی را برای پروژههای دیالوگمحور به میزان قابلتوجهی کاهش دهند.
دستورات متنی صریح، کنترل دقیقتر
بسیاری از سیستمهای بیانگر تبدیل متن به گفتار از نشانگرهای ثابتی مانند [whisper]، [laugh] یا (happy) استفاده میکنند. مدل Drama 3 توصیفات متنی اجرای مورد نظر را میپذیرد و به پرامپتها این امکان را میدهد تا ویژگیهای بیانی را ترکیب کنند که دایره واژگان برچسبهای ثابت قادر به پوشش آنها نیست.
قابلیت | تاثیر در تولید |
|---|---|
تغییر صدا در میانهی جمله | تغییر لحن، شخصیت یا انرژی در یک گفته واحد را ممکن میسازد و نیاز به برش زدن فایلهای صوتی مجزا را کاهش میدهد. |
صحنههای چند شخصیتی | یک مکالمه کامل را در یک مرحله پردازش تولید میکند و در عین حال تمایز گویندگان را در طول دیالوگها حفظ میکند. |
اصلاح تککلمهای | کلمهای که بد تلفظ شده یا اجرای ضعیفی داشته را جایگزین میکند، در حالی که صدای اطراف آن دستنخورده باقی میماند. |
فراخوانی API پیشنمایش
مدل Drama 3 از اندپوینت استاندارد تبدیل متن به گفتار Fish Audio استفاده میکند و از طریق هدر درخواست model انتخاب میشود. طبق مستندات API تبدیل متن به گفتار، drama-3-preview یک شناسه پیشنمایش است که رفتار و در دسترس بودن آن ممکن است تغییر کند. درخواستهایی که مقدار مدل در آنها حذف شده یا ناشناخته باشد، به s2.1-pro بازمیگردند.
درخواست زیر مدل Drama 3 را انتخاب کرده و فایل MP3 تولیدشده را در یک فایل محلی ذخیره میکند:
curl --request POST \\
--url https://api.fish.audio/v1/tts \\
--header 'Authorization: Bearer <token>' \\
--header 'Content-Type: application/json' \\
--header 'model: drama-3-preview' \\
--data '{
\"text\": \"She paused, then whispered: it was you all along.\",
\"format\": \"mp3\"
}' \\
--output take.mp3ساختار منتشرشده این درخواست نشاندهنده نحوه انتخاب مدل است، اما Fish Audio هنوز دستور زبان رسمی برای هدایت زبان طبیعی Drama 3 منتشر نکرده است. همچنین مشخص نیست که آیا اصلاح تککلمهای از این اندپوینت، یک عملیات API مجزا یا رابط کاربری پیشنمایش استفاده میکند. توسعهدهندگانی که قصد دارند گردشهای کاری ویرایشی خودکار ایجاد کنند، پیش از ادغام این ویژگی به این جزئیات نیاز دارند.
سازگاری مدلها نیز بسته به حالت سنتز متفاوت است. تولید تکگوینده در تمامی مدلهای سازگار تبدیل متن به گفتار کار میکند. دیالوگهای چندگوینده با s2-pro، s2.1-pro، s2.1-pro-free و drama-3-preview سازگار است؛ مدل قدیمیتر s1 فاقد این قابلیت است.
شرکت Fish Audio کلیدهای API پیشنمایش را از طریق درخواست در تاپیک معرفی خود توزیع کرده است، نه از طریق یک تنظیمات عمومی و خودکار. همچنین قیمتگذاری پیشنمایش هنوز منتشر نشده و هزینههای تولید و محدودیتهای استفاده نامشخص باقی مانده است.
توکنهای گوینده در لایههای زیرین
مدل Drama 3 بر پایه کارهای چندگوینده خانواده S2 ساخته شده است. بر اساس مستندات منتشرشده، S2 میتواند صدای مرجع حاوی چندین صدا را پردازش کند و هر گوینده را با یک توکن گوینده نشان دهد. سپس یک اسکریپت میتواند از شناسههای گوینده برای تخصیص دیالوگ در یک پردازش استفاده کند.
توکنهای گوینده به عنوان شناسههای صدای قابل استفاده مجدد در بستر مدل عمل میکنند. آنها به یک درخواست اجازه میدهند تا هویتهای جداگانه شخصیتها را در چندین دیالوگ حفظ کند و نیاز به سنتز جداگانه هر گوینده و مونتاژ صحنه در مرحله بعد را از بین میبرد.
بر اساس گزارشهای منتشرشده، این پیشنمایش قابلیت شبیهسازی صدای مدل S2 را نیز حفظ کرده است. این گردش کار، رنگ صدا، سبک صحبت کردن و تمایلات احساسی را از کلیپهای مرجعی که حدود ۱۰ تا ۳۰ ثانیه طول میکشند، بدون نیاز به تنظیم دقیق اضافی استخراج میکند. Drama 3 هدایت اجرای خط به خط را به صدای شبیهسازیشده اضافه میکند.
کاهش هزینههای ویرایش
تولید دیالوگ و تولید صدای محلیسازیشده روشنترین موارد استفاده هستند زیرا هر دو به شخصیتهای سازگار، تحویل متنوع و بازنگریهای مکرر نیاز دارند:
- درامهای کوتاه، انیمیشنها و بازیهایی با چندین شخصیت در هر صحنه.
- کتابهای صوتی که صداها و احساسات را در یک پاراگراف تغییر میدهند.
- صداگذاری پادکستها و ویدیوهایی که در مراحل پایانی دچار تغییر متن میشوند.
- خطوط لوله محلیسازی و دوبله که از صداهای شخصیتها در صحنههای مختلف استفاده مجدد میکنند.
اصلاح تککلمهای ممکن است بیشترین صرفهجویی فوری را در گردش کار ایجاد کند. یک نام با تلفظ اشتباه میتواند کلیپی که در غیر این صورت قابل استفاده بود را خراب کند، و تولید مجدد کامل اغلب زمانبندی، تاکید یا ریتم را در جاهای دیگر تغییر میدهد. جایگزینی محلی، اجرای پذیرفتهشده را حفظ کرده و ویرایشهای بعدی را محدود میکند.
نواقص مهم در نسخه پیشنمایش
شرکت Fish Audio مدل Drama 3 را به عنوان یک پیشنمایش معرفی کرده و هشدار میدهد که رفتار و در دسترس بودن آن ممکن است تغییر کند. این شرکت هنوز هیچ بنچمارک، اندازهگیری تأخیر، قیمتگذاری یا مقایسه رسمی با سیستمهایی مانند ElevenLabs v3 و مدلهای صوتی OpenAI منتشر نکرده است.
هدایت با زبان طبیعی همچنین سوالاتی در مورد تکرارپذیری ایجاد میکند. دستوراتی مانند «طعنهآمیز و عصبی» فضایی برای تفسیر باقی میگذارند، بنابراین تولیدهای مکرر ممکن است حتی زمانی که کلمات ثابت میمانند، متفاوت باشند. ارزیابی تولید باید ثبات در صداها، فیلمنامهها، زبانها و اجراهای مکرر را اندازهگیری کند.
تولید چندگوینده نیز به آزمایشهای مشابهی در مورد نشت گوینده، تخصیص نوبت، ثبات در صحنههای طولانی و تأخیر نیاز دارد. نتایج رسمی برای این موارد هنوز منتشر نشده است که این پیشنمایش را بیشتر برای ارزیابی مناسب میسازد تا وابستگیهای روبهمشتری با الزامات سختگیرانه قابلیت اطمینان.
تبدیل رابطهای صوتی به پرامپت
مدل Drama 3 پیرو تغییر گستردهتری در سنتز گفتار از کنترلهای ثابت به سمت مدلهای پیرویکننده از دستورالعمل است. رویکرد فنی اصلی آن این است که هدایت آزاد میتواند ترکیباتی از لحن، شخصیت و سرعت را پوشش دهد که برچسبهای از پیشتعریفشده نمیتوانند برشمارند. ارزش عملی این پیشنمایش بستگی به این دارد که این دستورالعملها با چه میزان قابلیت اطمینان در برداشتهای مختلف بازتولید شوند و آیا Fish Audio امکاناتی برای اصلاح، کنترل گوینده و پرامپتنویسی از طریق APIهای پایدار ارائه خواهد داد یا خیر.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.