شاهکار آزمایشگاه کیوتای؛ بازآموزی مدل صوتی PocketTTS با روش جدید و نرخ خطای فوقالعاده ۰.۹ درصد!
آزمایشگاه فرانسوی کیوتای با بازآموزی مدل صوتی کمحجم PocketTTS از طریق روش خلاقانه Drifting، موفق شد پیچیدگیهای محاسباتی سنگین را کنار بگذارد و به نرخ خطای خارقالعاده ۰.۹۰ درصد برسد. این مدل ۱۰۰ میلیون پارامتری به طور کامل روی CPU اجرا میشود، از شبیهسازی صدا و استریم زنده پشتیبانی میکند و با حفظ کیفیت چشمگیر، فرایند آموزش مدلهای گفتاری را بسیار سادهتر و بهینهتر کرده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- آزمایشگاه کیوتای (Kyutai) مدل تبدیل متن به گفتار کمحجم PocketTTS رو با تکنیک جدیدی به اسم Drifting بازآموزی کرده و تونسته روی بنچمارک LibriSpeech به نرخ خطای کلمه (WER) شگفتانگیز ۰.۹۰ درصد برسه.
- بزرگترین برگ برنده این آپدیت، حذف محاسبات ریاضی فوقالعاده پیچیده قبلیه؛ حالا مدل ۱۰۰ میلیون پارامتری بدون افت کیفیت در شبیهسازی صدا یا استریم، خیلی سرراستتر آموزش میبینه و کاملاً روی CPU لپتاپ اجرا میشه.
- این مدل تحت مجوز متنباز MIT منتشر شده، روی مکبوک M4 حدود ۶ برابر سریعتر از زمان واقعی صوت تولید میکنه و هر کسی میتونه فقط با دو دستور ساده در پایتون اون رو اجرا کنه.
آزمایشگاه پژوهشی کیوتای (Kyutai) گزارش فنی جذابی از بازآموزی مدل تبدیل متن به گفتار PocketTTS منتشر کرده است؛ مدلی ۱۰۰ میلیون پارامتری که کاملاً روی CPU اجرا میشود و این بار با یک تابع هدف تولیدیِ تکمرحلهای به نام «دریفتیگ» (Drifting) آموزش دیده است. چکپوینت بهدستآمده موفق شده نرخ خطای کلمه (WER) خارقالعاده ۰.۹۰ درصد را روی دیتاست LibriSpeech test-clean ثبت کند و در عین حال قابلیتهای کلیدی PocketTTS مثل کلون کردن صدا (Voice Cloning) و تولید زنده صدا به صورت استریم را به طور کامل حفظ نماید. بزرگترین مزیت این روش در فرایند آموزش، بهینهسازی بسیار سادهتر آن است؛ در واقع روش drifting محاسبات سنگین ضرب ژاکوبی در بردار (Jacobian-vector products) را که در تابع زیان قبلی کیوتای ضروری بود، به طور کامل حذف کرده است.
کیوتای مدل PocketTTS را نخستین مدل گفتاری و اولین مدل خودبازگشتی (Autoregressive) در دنیای هوش مصنوعی معرفی میکند که با هدف drifting آموزش دیده است؛ روشی نوآورانه که ابتدا در پژوهش دنگ و همکارانش (Deng et al.) مطرح شده بود. سازگار کردن این تکنیک با گفتار استریم و بلادرنگ، به یک فوت کوزهگری وابسته بود: تبدیل «دمای کِرنل» (Kernel Temperature) به پارامتری قابل یادگیری توسط مدل.
تولید یک لِیتنت صوتی در هر ۸۰ میلیثانیه
در حین تولید صدا، مدل PocketTTS در هر ۸۰ میلیثانیه یک نمایش صوتی پیوسته به نام لِیتنت (Latent) خروجی میدهد. در این معماری، یک ترنسفورمر علی (Causal Transformer) کلمات قبلی متن و زمینه صوتی پیشین را ردیابی میکند، در حالی که یک بخش نمونهبردار (Sampler Head) جمعوجور نویز گاوسی را تنها در یک مرحله عبور مستقیم (Forward Pass) به لیتنت بعدی تبدیل مینماید. همین نمونهبردار تکمرحلهای راز اصلی اجرای روان این مدل ۱۰۰ میلیون پارامتری روی پردازندههای معمولی (CPU) لپتاپهاست.

نمونهبردار قبلی این مدل از روش LSD بهره میبرد؛ یک تابع زیان تطبیق جریان (Flow-Matching) تکمرحلهای که یاد میگیرد چگونه نویز تصادفی را به دادههای صوتی معنادار تبدیل کند. با این حال، آموزش آن مستلزم محاسبات مشتقاتی سنگینی مثل ضرب ژاکوبی در بردار بود که بار محاسباتی و پیچیدگی پیادهسازی را به شدت بالا میبرد. تکنیک Drifting بدون نیاز به این محاسبات طاقتفرسا، به کیفیتی همتراز در بنچمارکها دست یافته است. البته کیوتای آمار دقیقی از زمان واقعی آموزش یا کاهش مصرف حافظه منتشر نکرده؛ بنابراین دستاورد اصلی فعلاً سادهتر شدن فوقالعاده فرایند آموزش است، نه لزوماً افزایش ثبتشده سرعت پردازش.
جاذبه، دافعه و فاکتور دما
در طول فرایند آموزش، نمونهبردار روش drifting برای هر موقعیت لیتنت، ۶۴ ذره کاندیدا (Particle) ایجاد میکند. یک میدان رانش مبتنی بر کرْنل وارد عمل میشود و تکتک این ذرات را به سمت لیتنت صوتی هدف میکشد (جاذبه) و همزمان آنها را از یکدیگر دور میکند (دافعه). نیروی جاذبه خروجی صحیح را به مدل یاد میدهد، در حالی که نیروی دافعه تنوع دادهها را حفظ کرده و جلوی مشکلی به نام فروپاشی مد (Mode Collapse) را میگیرد—وضعیتی که در آن مدل برای نویزهای ورودی متفاوت، خروجیهای تقریباً یکسانی تحویل میدهد. با تمام این جزئیات در زمان آموزش، در فاز استنتاج (Inference) مدل همچنان هر لیتنت را تنها با یک بار عبور از نمونهبردار خلق میکند.
دمای کرنل (Kernel Temperature) مقیاس و شدت برهمکنش میان این ذرات را تنظیم میکند. تیم کیوتای در فازهایی که وزن تابع زیان دما مثبت تعریف شده بود، این دما را بهروزرسانی کردند و سپس در مراحل بعدی تیونینگ دقیق (Fine-tuning) که این وزن صفر شد، مقدار یادگرفتهشده را ثابت نگه داشتند. تنظیم دستی و ثابت دما برای مدلهای گفتاری خودبازگشتی بسیار ناپایدار و شکننده از آب درآمده بود؛ در نتیجه، واگذاری یادگیری این فاکتور به خود مدل، پایداری لازم را برای تکمیل موفقیتآمیز آموزش فراهم کرد.
کیفیت بالا در قالبی جمعوجور
کیوتای وضوح و دقت کلام را با معیار «نرخ خطای کلمه» (Word Error Rate یا WER) ارزیابی میکند؛ به این صورت که گفتار تولیدشده پیادهسازی متنی میشود و با متن ورودی اولیه مقایسه میگردد (طبیعتاً هرچه این عدد کمتر باشد، عملکرد بهتر است). شاخص UTMOS نیز یک تخمین خودکار از کیفیت شنیداری صداست که برعکس WER، مقادیر بالاتر آن نشاندهنده کیفیت طبیعیتر و شفافتر صدا هستند.
چکپوینت | تابع زیان آموزش | نرخ خطا (WER) | شاخص کیفیت (UTMOS) |
|---|---|---|---|
english_2026-09 | LSD | 0.90% | 4.36 |
english_drifting_26-09 | Drifting | 0.90% | 4.37 |
فرایند آموزش در دو مرحله انجام میپذیرد. کیوتای ابتدا یک مدل معلم (Teacher) ۲۴ لایه را در ۴۰۰ هزار گام و با نرخ یادگیری ثابت آموزش میدهد که به نرخ خطای ۱.۰۱ درصد و نمره کیفی ۴.۲۶ در آزمون LibriSpeech test-clean دست مییابد. سپس از طریق روش تقطیر عمقی (Depth Distillation)، مدل معلم فشرده شده و به یک دانشآموز ۶ لایه تبدیل میشود. مدل دانشآموز منتشرشده همچنین از طریق تقطیر هدایت بدون طبقهبندیکننده (Classifier-Free Guidance Distillation) با مقیاس هدایت ۲.۰ تعلیم میبیند؛ این ترفند هوشمندانه باعث میشود رفتار هدایتشده معلم مستقیماً در ساختار شبکه کوچکتر جا بگیرد تا تولید صدا در زمان اجرا همچنان به صورت تکمرحلهای باقی بماند.
جدول منتشرشده مربوط به گفتار تمیز کتابهای صوتی انگلیسی است و کیفیت آن توسط یک ابزار ارزیابی خودکار سنجیده شده است. در این گزارش هنوز آماری از میزان شباهت صدای کلونشده به گوینده اصلی، عملکرد مدل در متون نویزدار، لهجههای گوناگون، اصطلاحات تخصصی و پایداری در گفتارهای طولانی ارائه نشده است. بنابراین برای استفاده در محیطهای عملیاتی و پروداکشن، بهتر است ارزیابیها با صداها و محتواهای متنوعتری در کنار این بنچمارک رسمی انجام گیرد.
چالش جدی مدلهای خودبازگشتی
تولید گفتار با مدلهای خودبازگشتی یک آزمون بسیار دشوار و نفسگیر برای نمونهبردارهای تکمرحلهای به شمار میرود؛ چرا که هر لیتنت تولیدشده، بلافاصله به زمینه و ورودی لیتنت بعدی تبدیل میشود. در چنین شرایطی، کوچکترین خطاها میتوانند در طول یک جمله روی هم انباشته شوند و تلفظ کلمات، ریتم گفتار یا پایداری لحن را به کلی تخریب کنند. ثبت نرخ خطای ۰.۹۰ درصدی این مدل اثبات میکند که روش drifting در سراسر توالی گفتار پایداری فوقالعادهای دارد و موفقیت آزمایشهای پیشین خود را که تنها در زمینه تولید تکمرحلهای تصاویر بود، این بار در پردازش صدا با قدرت تکرار کرده است.
یک تحلیل نظری جداگانه نیز نشان میدهد روش drifting با تکنیکهای تثبیتشده تطبیق امتیاز (Score-Matching) پیوند نزدیکی دارد. در حضور یک کرنل گاوسی، اپراتور رانش دقیقاً معادل اختلاف امتیاز بین توزیعهای هموارشده است. مفهوم «امتیاز» (Score) در ریاضیات همان گرادیانی است که به سمت نواحی با احتمال بالاتر اشاره میکند—دقیقاً همان ابزاری که در آموزش مدلهای دیفیوژن به کار میرود. این همبستگی نظری به پژوهشگران امکان میدهد با بهرهگیری از مفاهیم آشنای مدلهای دیفیوژن، منطق رفتاری و سازوکار دریفتیگ را بسیار بهتر درک و تحلیل کنند.
نحوه اجرای چکپوینت جدید
وزنهای جدید مدل از طریق همان پکیج رسمی و فعلی PocketTTS در دسترس قرار گرفتهاند. کافی است چکپوینت english_drifting_26-09 را انتخاب کنید تا بدون نیاز به تغییر در کدها یا مسیر استنتاج، مدل جدید به کار گرفته شود.
- دارای ۱۰۰ میلیون پارامتر تحت مجوز کاملاً متنباز MIT
- قابلیت اجرای استنتاج روی CPU با تنها دو هسته پردازشی
- تاخیر بسیار کم؛ ارسال اولین تکه صدا در حدود ۲۰۰ میلیثانیه
- سرعت خیرهکننده؛ حدود ۶ برابر سریعتر از زمان واقعی روی پردازنده M4 مکبوک ایر
- شبیهسازی صدا (Voice Cloning) تنها با داشتن یک نمونه فایل صوتی کوتاه WAV
- پشتیبانی از خروجی استریم و پردازش متنهایی با طول نامحدود
- پورتهای ارائهشده توسط جامعه کاربری برای پلتفرمهای WebAssembly، ONNX و MLX
شروع کار فقط با دو دستور ساده
pip install pocket-tts
pocket-tts generate --language english_drifting_26-09 --text "Hello world"سیستمهایی که هماکنون از این مدل استفاده میکنند، میتوانند صرفاً با تغییر شناسه مدل و حفظ تمام کدهای قبلی، چکپوینت جدید را محک بزنند. برای تیمهایی هم که قصد دارند هِدهای تولیدی تکمرحلهای را آموزش دهند، فرمول پیشنهادی کیوتای یک نقشه راه درخشان ارائه میدهد: روش LSD و محاسبات پیچیده ژاکوبی-بردار را با Drifting جایگزین کنید، دمای کِرنل را به مدل بیاموزید و پس از تقطیر، سرعت خیرهکننده تولید تکمرحلهای را حفظ نمایید.
مطالب مرتبط و پیشنهادی

معرفی پروژه متنباز OpenDots توسط CopilotKit؛ ساخت همکاران هوش مصنوعی همیشهبیدار با دسترسی به وب، اسلک و صدا
تیم CopilotKit با انتشار قالب متنباز OpenDots، ساخت همکاران هوش مصنوعی همیشهبیدار را برای برنامهنویسان راحتتر از همیشه کرده است. این ابزار به ایجنتها اجازه میدهد به وب، اسلک و حتی مکالمات صوتی دسترسی داشته باشند و در محیطهایی کاملاً ایزوله کارهای تیمی را جلو ببرند.

۹ دستور «اسلش» شگفتانگیز در چتجیپیتی برای گرفتن بهترین پاسخها
اگر از پرحرفی یا پاسخهای کلیشهای چتجیپیتی کلافه شدهاید، با اضافه کردن چند دستور ساده با علامت اسلش (/) میتوانید خروجی هوش مصنوعی را متحول کنید. در این راهنما با ۹ دستور کاربردی آشنا میشوید که کیفیت پاسخهای مدلهای زبانی را به اوج میرسانند.

آیا چتباتها میتوانند آرامش را واگیردار کنند؟ راز پدیده «سرایت ذهنآگاهی» با هوش مصنوعی
همانطور که احساسات مثبت و منفی بین انسانها دستبهدست میشود، کارشناسان معتقدند «ذهنآگاهی» هم میتواند سرایت کند. با فعالیت صدها میلیون کاربر در چتباتهای هوش مصنوعی، این فناوری میتواند کاتالیزوری برای انتشار آرامش درونی باشد؛ هرچند خطر افتادن به ورطه بیفکری و رخوت ذهنی هم بیخ گوش ماست.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.