پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار آزمایشگاه کیوتای؛ بازآموزی مدل صوتی PocketTTS با روش جدید و نرخ خطای فوق‌العاده ۰.۹ درصد!

انتشار:۱۰ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

آزمایشگاه فرانسوی کیوتای با بازآموزی مدل صوتی کم‌حجم PocketTTS از طریق روش خلاقانه Drifting، موفق شد پیچیدگی‌های محاسباتی سنگین را کنار بگذارد و به نرخ خطای خارق‌العاده ۰.۹۰ درصد برسد. این مدل ۱۰۰ میلیون پارامتری به طور کامل روی CPU اجرا می‌شود، از شبیه‌سازی صدا و استریم زنده پشتیبانی می‌کند و با حفظ کیفیت چشمگیر، فرایند آموزش مدل‌های گفتاری را بسیار ساده‌تر و بهینه‌تر کرده است.

شاهکار آزمایشگاه کیوتای؛ بازآموزی مدل صوتی PocketTTS با روش جدید و نرخ خطای فوق‌العاده ۰.۹ درصد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • آزمایشگاه کیوتای (Kyutai) مدل تبدیل متن به گفتار کم‌حجم PocketTTS رو با تکنیک جدیدی به اسم Drifting بازآموزی کرده و تونسته روی بنچمارک LibriSpeech به نرخ خطای کلمه (WER) شگفت‌انگیز ۰.۹۰ درصد برسه.
  • بزرگ‌ترین برگ برنده این آپدیت، حذف محاسبات ریاضی فوق‌العاده پیچیده قبلیه؛ حالا مدل ۱۰۰ میلیون پارامتری بدون افت کیفیت در شبیه‌سازی صدا یا استریم، خیلی سرراست‌تر آموزش می‌بینه و کاملاً روی CPU لپ‌تاپ اجرا می‌شه.
  • این مدل تحت مجوز متن‌باز MIT منتشر شده، روی مک‌بوک M4 حدود ۶ برابر سریع‌تر از زمان واقعی صوت تولید می‌کنه و هر کسی می‌تونه فقط با دو دستور ساده در پایتون اون رو اجرا کنه.

آزمایشگاه پژوهشی کیوتای (Kyutai) گزارش فنی جذابی از بازآموزی مدل تبدیل متن به گفتار PocketTTS منتشر کرده است؛ مدلی ۱۰۰ میلیون پارامتری که کاملاً روی CPU اجرا می‌شود و این بار با یک تابع هدف تولیدیِ تک‌مرحله‌ای به نام «دریفتیگ» (Drifting) آموزش دیده است. چک‌پوینت به‌دست‌آمده موفق شده نرخ خطای کلمه (WER) خارق‌العاده ۰.۹۰ درصد را روی دیتاست LibriSpeech test-clean ثبت کند و در عین حال قابلیت‌های کلیدی PocketTTS مثل کلون کردن صدا (Voice Cloning) و تولید زنده صدا به صورت استریم را به طور کامل حفظ نماید. بزرگ‌ترین مزیت این روش در فرایند آموزش، بهینه‌سازی بسیار ساده‌تر آن است؛ در واقع روش drifting محاسبات سنگین ضرب ژاکوبی در بردار (Jacobian-vector products) را که در تابع زیان قبلی کیوتای ضروری بود، به طور کامل حذف کرده است.

کیوتای مدل PocketTTS را نخستین مدل گفتاری و اولین مدل خودبازگشتی (Autoregressive) در دنیای هوش مصنوعی معرفی می‌کند که با هدف drifting آموزش دیده است؛ روشی نوآورانه که ابتدا در پژوهش دنگ و همکارانش (Deng et al.) مطرح شده بود. سازگار کردن این تکنیک با گفتار استریم و بلادرنگ، به یک فوت کوزه‌گری وابسته بود: تبدیل «دمای کِرنل» (Kernel Temperature) به پارامتری قابل یادگیری توسط مدل.

تولید یک لِیتنت صوتی در هر ۸۰ میلی‌ثانیه

در حین تولید صدا، مدل PocketTTS در هر ۸۰ میلی‌ثانیه یک نمایش صوتی پیوسته به نام لِیتنت (Latent) خروجی می‌دهد. در این معماری، یک ترنسفورمر علی (Causal Transformer) کلمات قبلی متن و زمینه صوتی پیشین را ردیابی می‌کند، در حالی که یک بخش نمونه‌بردار (Sampler Head) جمع‌وجور نویز گاوسی را تنها در یک مرحله عبور مستقیم (Forward Pass) به لیتنت بعدی تبدیل می‌نماید. همین نمونه‌بردار تک‌مرحله‌ای راز اصلی اجرای روان این مدل ۱۰۰ میلیون پارامتری روی پردازنده‌های معمولی (CPU) لپ‌تاپ‌هاست.

PocketTTS causal transformer feeding a one-step sampler head
مدل PocketTTS از ستون فقرات ترنسفورمر علی به همراه یک هِد نمونه‌بردار تک‌مرحله‌ای برای تولید لِیتنت‌های پیوسته صوتی استفاده می‌کند.

نمونه‌بردار قبلی این مدل از روش LSD بهره می‌برد؛ یک تابع زیان تطبیق جریان (Flow-Matching) تک‌مرحله‌ای که یاد می‌گیرد چگونه نویز تصادفی را به داده‌های صوتی معنادار تبدیل کند. با این حال، آموزش آن مستلزم محاسبات مشتقاتی سنگینی مثل ضرب ژاکوبی در بردار بود که بار محاسباتی و پیچیدگی پیاده‌سازی را به شدت بالا می‌برد. تکنیک Drifting بدون نیاز به این محاسبات طاقت‌فرسا، به کیفیتی هم‌تراز در بنچمارک‌ها دست یافته است. البته کیوتای آمار دقیقی از زمان واقعی آموزش یا کاهش مصرف حافظه منتشر نکرده؛ بنابراین دستاورد اصلی فعلاً ساده‌تر شدن فوق‌العاده فرایند آموزش است، نه لزوماً افزایش ثبت‌شده سرعت پردازش.

جاذبه، دافعه و فاکتور دما

در طول فرایند آموزش، نمونه‌بردار روش drifting برای هر موقعیت لیتنت، ۶۴ ذره کاندیدا (Particle) ایجاد می‌کند. یک میدان رانش مبتنی بر کرْنل وارد عمل می‌شود و تک‌تک این ذرات را به سمت لیتنت صوتی هدف می‌کشد (جاذبه) و هم‌زمان آن‌ها را از یکدیگر دور می‌کند (دافعه). نیروی جاذبه خروجی صحیح را به مدل یاد می‌دهد، در حالی که نیروی دافعه تنوع داده‌ها را حفظ کرده و جلوی مشکلی به نام فروپاشی مد (Mode Collapse) را می‌گیرد—وضعیتی که در آن مدل برای نویزهای ورودی متفاوت، خروجی‌های تقریباً یکسانی تحویل می‌دهد. با تمام این جزئیات در زمان آموزش، در فاز استنتاج (Inference) مدل همچنان هر لیتنت را تنها با یک بار عبور از نمونه‌بردار خلق می‌کند.

دمای کرنل (Kernel Temperature) مقیاس و شدت برهم‌کنش میان این ذرات را تنظیم می‌کند. تیم کیوتای در فازهایی که وزن تابع زیان دما مثبت تعریف شده بود، این دما را به‌روزرسانی کردند و سپس در مراحل بعدی تیونینگ دقیق (Fine-tuning) که این وزن صفر شد، مقدار یادگرفته‌شده را ثابت نگه داشتند. تنظیم دستی و ثابت دما برای مدل‌های گفتاری خودبازگشتی بسیار ناپایدار و شکننده از آب درآمده بود؛ در نتیجه، واگذاری یادگیری این فاکتور به خود مدل، پایداری لازم را برای تکمیل موفقیت‌آمیز آموزش فراهم کرد.

کیفیت بالا در قالبی جمع‌وجور

کیوتای وضوح و دقت کلام را با معیار «نرخ خطای کلمه» (Word Error Rate یا WER) ارزیابی می‌کند؛ به این صورت که گفتار تولیدشده پیاده‌سازی متنی می‌شود و با متن ورودی اولیه مقایسه می‌گردد (طبیعتاً هرچه این عدد کم‌تر باشد، عملکرد بهتر است). شاخص UTMOS نیز یک تخمین خودکار از کیفیت شنیداری صداست که برعکس WER، مقادیر بالا‌تر آن نشان‌دهنده کیفیت طبیعی‌تر و شفاف‌تر صدا هستند.

چک‌پوینت
تابع زیان آموزش
نرخ خطا (WER)
شاخص کیفیت (UTMOS)
english_2026-09
LSD
0.90%
4.36
english_drifting_26-09
Drifting
0.90%
4.37

فرایند آموزش در دو مرحله انجام می‌پذیرد. کیوتای ابتدا یک مدل معلم (Teacher) ۲۴ لایه را در ۴۰۰ هزار گام و با نرخ یادگیری ثابت آموزش می‌دهد که به نرخ خطای ۱.۰۱ درصد و نمره کیفی ۴.۲۶ در آزمون LibriSpeech test-clean دست می‌یابد. سپس از طریق روش تقطیر عمقی (Depth Distillation)، مدل معلم فشرده شده و به یک دانش‌آموز ۶ لایه تبدیل می‌شود. مدل دانش‌آموز منتشرشده همچنین از طریق تقطیر هدایت بدون طبقه‌بندی‌کننده (Classifier-Free Guidance Distillation) با مقیاس هدایت ۲.۰ تعلیم می‌بیند؛ این ترفند هوشمندانه باعث می‌شود رفتار هدایت‌شده معلم مستقیماً در ساختار شبکه کوچک‌تر جا بگیرد تا تولید صدا در زمان اجرا همچنان به صورت تک‌مرحله‌ای باقی بماند.

جدول منتشرشده مربوط به گفتار تمیز کتاب‌های صوتی انگلیسی است و کیفیت آن توسط یک ابزار ارزیابی خودکار سنجیده شده است. در این گزارش هنوز آماری از میزان شباهت صدای کلون‌شده به گوینده اصلی، عملکرد مدل در متون نویزدار، لهجه‌های گوناگون، اصطلاحات تخصصی و پایداری در گفتارهای طولانی ارائه نشده است. بنابراین برای استفاده در محیط‌های عملیاتی و پروداکشن، بهتر است ارزیابی‌ها با صداها و محتواهای متنوع‌تری در کنار این بنچمارک رسمی انجام گیرد.

چالش جدی مدل‌های خودبازگشتی

تولید گفتار با مدل‌های خودبازگشتی یک آزمون بسیار دشوار و نفس‌گیر برای نمونه‌بردارهای تک‌مرحله‌ای به شمار می‌رود؛ چرا که هر لیتنت تولیدشده، بلافاصله به زمینه و ورودی لیتنت بعدی تبدیل می‌شود. در چنین شرایطی، کوچک‌ترین خطاها می‌توانند در طول یک جمله روی هم انباشته شوند و تلفظ کلمات، ریتم گفتار یا پایداری لحن را به کلی تخریب کنند. ثبت نرخ خطای ۰.۹۰ درصدی این مدل اثبات می‌کند که روش drifting در سراسر توالی گفتار پایداری فوق‌العاده‌ای دارد و موفقیت آزمایش‌های پیشین خود را که تنها در زمینه تولید تک‌مرحله‌ای تصاویر بود، این بار در پردازش صدا با قدرت تکرار کرده است.

یک تحلیل نظری جداگانه نیز نشان می‌دهد روش drifting با تکنیک‌های تثبیت‌شده تطبیق امتیاز (Score-Matching) پیوند نزدیکی دارد. در حضور یک کرنل گاوسی، اپراتور رانش دقیقاً معادل اختلاف امتیاز بین توزیع‌های هموارشده است. مفهوم «امتیاز» (Score) در ریاضیات همان گرادیانی است که به سمت نواحی با احتمال بالا‌تر اشاره می‌کند—دقیقاً همان ابزاری که در آموزش مدل‌های دیفیوژن به کار می‌رود. این همبستگی نظری به پژوهشگران امکان می‌دهد با بهره‌گیری از مفاهیم آشنای مدل‌های دیفیوژن، منطق رفتاری و سازوکار دریفتیگ را بسیار بهتر درک و تحلیل کنند.

نحوه اجرای چک‌پوینت جدید

وزن‌های جدید مدل از طریق همان پکیج رسمی و فعلی PocketTTS در دسترس قرار گرفته‌اند. کافی است چک‌پوینت english_drifting_26-09 را انتخاب کنید تا بدون نیاز به تغییر در کدها یا مسیر استنتاج، مدل جدید به کار گرفته شود.

  • دارای ۱۰۰ میلیون پارامتر تحت مجوز کاملاً متن‌باز MIT
  • قابلیت اجرای استنتاج روی CPU با تنها دو هسته پردازشی
  • تاخیر بسیار کم؛ ارسال اولین تکه صدا در حدود ۲۰۰ میلی‌ثانیه
  • سرعت خیره‌کننده؛ حدود ۶ برابر سریع‌تر از زمان واقعی روی پردازنده M4 مک‌بوک ایر
  • شبیه‌سازی صدا (Voice Cloning) تنها با داشتن یک نمونه فایل صوتی کوتاه WAV
  • پشتیبانی از خروجی استریم و پردازش متن‌هایی با طول نامحدود
  • پورت‌های ارائه‌شده توسط جامعه کاربری برای پلتفرم‌های WebAssembly، ONNX و MLX

شروع کار فقط با دو دستور ساده

pip install pocket-tts
pocket-tts generate --language english_drifting_26-09 --text "Hello world"

سیستم‌هایی که هم‌اکنون از این مدل استفاده می‌کنند، می‌توانند صرفاً با تغییر شناسه مدل و حفظ تمام کدهای قبلی، چک‌پوینت جدید را محک بزنند. برای تیم‌هایی هم که قصد دارند هِدهای تولیدی تک‌مرحله‌ای را آموزش دهند، فرمول پیشنهادی کیوتای یک نقشه راه درخشان ارائه می‌دهد: روش LSD و محاسبات پیچیده ژاکوبی-بردار را با Drifting جایگزین کنید، دمای کِرنل را به مدل بیاموزید و پس از تقطیر، سرعت خیره‌کننده تولید تک‌مرحله‌ای را حفظ نمایید.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

معرفی پروژه متن‌باز OpenDots توسط CopilotKit؛ ساخت همکاران هوش مصنوعی همیشه‌بیدار با دسترسی به وب، اسلک و صدا
آخرین اخبار

معرفی پروژه متن‌باز OpenDots توسط CopilotKit؛ ساخت همکاران هوش مصنوعی همیشه‌بیدار با دسترسی به وب، اسلک و صدا

تیم CopilotKit با انتشار قالب متن‌باز OpenDots، ساخت همکاران هوش مصنوعی همیشه‌بیدار را برای برنامه‌نویسان راحت‌تر از همیشه کرده است. این ابزار به ایجنت‌ها اجازه می‌دهد به وب، اسلک و حتی مکالمات صوتی دسترسی داشته باشند و در محیط‌هایی کاملاً ایزوله کار‌های تیمی را جلو ببرند.

۲ دقیقه مطالعه
۰
۱۰ مهر
۹ دستور «اسلش» شگفت‌انگیز در چت‌جی‌پی‌تی برای گرفتن بهترین پاسخ‌ها
آخرین اخبار

۹ دستور «اسلش» شگفت‌انگیز در چت‌جی‌پی‌تی برای گرفتن بهترین پاسخ‌ها

اگر از پرحرفی یا پاسخ‌های کلیشه‌ای چت‌جی‌پی‌تی کلافه شده‌اید، با اضافه کردن چند دستور ساده با علامت اسلش (/) می‌توانید خروجی هوش مصنوعی را متحول کنید. در این راهنما با ۹ دستور کاربردی آشنا می‌شوید که کیفیت پاسخ‌های مدل‌های زبانی را به اوج می‌رسانند.

۷ دقیقه مطالعه
۰
۱۰ مهر
آیا چت‌بات‌ها می‌توانند آرامش را واگیردار کنند؟ راز پدیده «سرایت ذهن‌آگاهی» با هوش مصنوعی
آخرین اخبار

آیا چت‌بات‌ها می‌توانند آرامش را واگیردار کنند؟ راز پدیده «سرایت ذهن‌آگاهی» با هوش مصنوعی

همان‌طور که احساسات مثبت و منفی بین انسان‌ها دست‌به‌دست می‌شود، کارشناسان معتقدند «ذهن‌آگاهی» هم می‌تواند سرایت کند. با فعالیت صدها میلیون کاربر در چت‌بات‌های هوش مصنوعی، این فناوری می‌تواند کاتالیزوری برای انتشار آرامش درونی باشد؛ هرچند خطر افتادن به ورطه بی‌فکری و رخوت ذهنی هم بیخ گوش ماست.

۱۰ دقیقه مطالعه
۰
۱۰ مهر