شاهکار ۳۴ مگابایتی برای زبان ترکی؛ مدل کوچک EMA Lightning چطور ElevenLabs را به چالش کشید؟
یک توسعهدهنده با معرفی مدل سبکوزن EMA Lightning نشان داد که برای تولید صدای باکیفیت همیشه به پردازشهای سنگین ابری نیاز نیست. این مدل با حجم ناچیز ۳۴ مگابایت و تنها ۸.۶ میلیون پارامتر، بهصورت کاملاً آفلاین روی سیستم شما اجرا میشود و در زبان ترکی حتی از غولهایی مثل ElevenLabs و جمینای هم خطای کمتری ثبت کرده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل تبدیل متن به صدای EMA Lightning فقط ۸.۶ میلیون پارامتر و ۳۴ مگابایت حجم دارد و میتواند کاملاً آفلاین روی پردازنده معمولی (CPU) بدون نیاز به اینترنت اجرا شود.
- در بنچمارکهای زبان ترکی، این مدل نرخ خطای کلمات (WER) کمتری نسبت به ElevenLabs v4، مدل جمینای ۳.۸ فلش و حتی مدل سنگین ۲.۳۸ میلیارد پارامتری Trendyol ثبت کرده است.
- این پروژه با مجوز متنباز Apache 2.0 به همراه وزنها و کدهای پایتون منتشر شده، هرچند فعلاً تنها یک صدای ثابت تولید میکند و تنوع احساسی محدودی دارد.
مدل EMA Lightning؛ تبدیل متن به گفتار فقط در ۳۴ مگابایت
جانبرک اصلان (Canberk Aslan) بهتازگی مدل تبدیل متن به گفتار EMA Lightning را با تنها ۸.۶ میلیون پارامتر برای زبان ترکی منتشر کرده است. بر اساس بنچمارکهای ارائهشده همراه با این مدل، وقتی آن را بهصورت محلی روی پردازنده اصلی (CPU) یا کارت گرافیک (GPU) اجرا میکنید، نرخ خطای کلمات (WER) کمتری نسبت به ElevenLabs v4، مدل جمینای ۳.۸ فلش گوگل و حتی مدل غولپیکر Trendyol-TTS با ۲.۳۸ میلیارد پارامتر ثبت میکند!
این پروژه تحت مجوز متنباز Apache 2.0 منتشر شده و شامل وزنهای مدل، کدهای منبع و یک پکیج پایتون است. کل این مجموعه تنها ۳۴ مگابایت فضا میگیرد، یک صدای ثابت ترکی تولید میکند و هیچ نیازی به اتصال اینترنت یا APIهای ابری ندارد؛ قابلیتی که آن را به گزینهای ایدهآل برای توسعهدهندگانی تبدیل کرده که به دنبال تولید صدای ارزان، آفلاین و بدون تاخیرهای متغیر شبکه هستند.
پیشتازی در بنچمارکها در کنار محدودیتهای مشخص
در ارزیابیهای انجامشده روی مجموعه آزمایشی Freya-TR-Eval که شامل ۴۹۵ جمله به زبان ترکی است، این مدل نرخ خطای کلمات ۰.۹۲ درصدی را ثبت کرده است. جالب اینجاست که مدل رقیب یعنی Trendyol-TTS حدود ۲۷۷ برابر از نظر تعداد پارامتر بزرگتر است، اما در همین مقایسه به نرخ خطای ۰.۹۵ درصدی رسیده است.
سیستم / مدل | تعداد پارامترها | نرخ خطا (WER) | امتیاز UTMOS |
|---|---|---|---|
EMA Lightning | ۸.۶ میلیون | ۰.۹۲٪ | ۳.۳۰ |
Trendyol-TTS | ۲.۳۸ میلیارد | ۰.۹۵٪ | ۳.۸۳ |
Gemini 3.8 Flash | اعلامنشده | ۱.۳۵٪ | ۳.۵۲ تا ۳.۶۱ |
ElevenLabs v4 | اعلامنشده | ۱.۴۳٪ | حدود ۳.۳۰ |
معیار نرخ خطای کلمات (WER) نشان میدهد که یک سیستم تشخیص گفتار چقدر دقیق میتواند کلمات خواندهشده را بازشناسی و پیادهسازی کند؛ بنابراین هرچه این عدد پایینتر باشد، وضوح و خوانایی کلمات تولیدی بیشتر است. با این حال، این معیار فقط خوانا بودن کلمات را میسنجد، نه جذابیت لحن، احساسات یا دامنه بیانی گوینده را. علاوه بر این، نتایج ارائهشده بر اساس آزمون نویسنده روی ۴۹۵ جمله است و برای اثبات دقیقتر توانایی مدل در متون و سبکهای مختلف، به ارزیابیهای مستقل و گستردهتری نیاز خواهد بود.
معیار UTMOS نیز یک تخمین خودکار از کیفیت شنیداری صدا است که نمره بالاتر در آن نشاندهنده حس طبیعیتر بودن گفتار است. مدل EMA Lightning با کسب امتیاز ۳.۳۰ دقیقاً با عملکرد گزارششده ElevenLabs برابری میکند، هرچند همچنان پشت سر جمینای و Trendyol-TTS قرار میگیرد. ناگفته نماند که در این مقایسه منتشرشده هنوز هیچ نظرسنجی یا آزمایشی با شنوندگان انسانی انجام نشده است.
مطالب مرتبط و پیشنهادی

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد
یک اخترفیزیکدان در دانشگاه جانز هاپکینز با استفاده از پلتفرم Claude Science موفق شد یکسوم گمشده از نقشه فرابنفش کیهان را بازسازی و کامل کند. این پروژه عظیم که در گذشته به ماهها کار طاقتفرسا نیاز داشت، حالا به لطف ایجنتهای هوشمند کلود و در عرض چند روز به سرانجام رسیده است.

سرمایهگذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانههای هوش مصنوعی شد!
انویدیا از اختصاص یک میلیارد دلار برای توسعه پژوهشهای علمی و ابررایانههای هوش مصنوعی در آمریکا خبر داد؛ بودجهای که برای این غول تراشهساز حکم پول خرد را دارد اما ارتش پردازشی این کشور را در رقابت با چین تقویت میکند. این طرح بلندپروازانه با تجهیز آزمایشگاههای ملی به تراشههای بلکول، پیشتازی هوش مصنوعی و محاسبات کوانتومی را هدف گرفته است.

تاکسی خودران اختصاصی ایکسپنگ به خیابانها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تستهای عمومی
شرکت چینی ایکسپنگ (XPENG) با معرفی برند جهانی «XPENG YOYO» رسماً وارد فاز آزمایش عمومی تاکسیهای خودران خود شد. این روبوتاکسی تمامعیار با تکیه بر ۴ تراشه هوش مصنوعی تورینگ و مدل پیشرفته بینایی-زبانی VLA 2.0، بدون نیاز به لیدار در خیابانها مسافرگیری میکند. کاربران منتخب در چین از همین حالا میتوانند با کدهای دعوت اختصاصی، سفر در کابین لوکس و هوشمند این تاکسی را تجربه کنند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.