شگفتی مدل ۳۰ مگابایتی Antalia-2 Mini: شکست غولهای چند میلیاردی در تبدیل متن به گفتار ترکی!
تیم هوش مصنوعی PatientDesk با معرفی مدل Antalia-2 Mini نشان داد که برای دستیابی به خروجی صوتی باکیفیت همیشه نیازی به مدلهای سنگین نیست؛ این مدل متنباز ترکی با حجم باورنکردنی ۳۰ مگابایت حتی روی پردازندههای معمولی (CPU) اجرا میشود. نتایج بررسیها نشان میدهد که این مدل فوقالعاده سبک با کنار زدن مدلهای چند میلیارد پارامتری، دقت شگفتانگیزی را در تبدیل متن به گفتار به نمایش گذاشته است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل صوتی Antalia-2 Mini با تنها ۷.۶۲ میلیون پارامتر و حجم ۳۰.۵ مگابایتی منتشر شده و به لطف مجوز متنباز Apache 2.0، امکان اجرای محلی روی پردازندههای معمولی (CPU) و حتی مرورگر را فراهم میکند.
- سازندگان این مدل برای ثبت بیشترین سرعت و کمترین تأخیر، پیچیدگیهای چندزبانه را کنار گذاشته و کل معماری را بهطور اختصاصی روی یک زبان (ترکی) و یک صدای ثابت متمرکز کردهاند.
- در تستهای استاندارد Freya-TR-Eval، این مدل جمعوجور با ثبت خطای کاراکتر فوقالعاده پایین (۰.۱۹٪)، عملکردی دقیقتر از غولهای چند میلیارد پارامتری مانند Trendyol-TTS و حتی جمینای ثبت کرده است.
اجرای تبدیل متن به گفتار ترکی روی CPU با مدل سبک Antalia-2 Mini
مدل Antalia-2 Mini یک مدل متنباز تبدیل متن به گفتار (TTS) برای زبان ترکی است که بهطور ویژه برای پردازش محلی و بدون نیاز به کارت گرافیک (فقط با اتکا به CPU) توسعه پیدا کرده است. این مدل جمعوجور با دارا بودن تنها ۷.۶۲ میلیون پارامتر، در قالب fp32 فقط ۳۰.۵ مگابایت فضا اشغال میکند. خبر خوب برای جامعه متنباز این است که وزنهای مدل، ابزار نرمالسازی متن و کل فرآیند آموزش آن تحت مجوز کاملاً آزاد Apache 2.0 در دسترس همگان قرار گرفته است.
تا پیش از این، توسعهدهندگان زبان ترکی همیشه سر یک دوراهی سخت قرار داشتند: یا باید سراغ ایپیآیهای ابری و پرهزینه میرفتند، یا مدلهای چندزبانه و غولپیکر چند گیگابایتی را دانلود میکردند، یا اینکه به سیستمهای کوچک اما پر از خطای تلفظ رضایت میدادند. حالا Antalia-2 Mini با یک فرمول هوشمندانه وارد میدان شده است؛ این مدل تنوع زبانی و صداهای گوناگون را کنار گذاشته و تمام تمرکزش را روی یک زبان و یک صدای ثابت جمع کرده تا در ازای آن، سرعت بالا، تأخیر فوقالعاده کم و حجم بسیار سبکی را به ارمغان بیاورد.
تعداد پارامترها | ۷.۶۲ میلیون |
|---|---|
حجم وزنها | ۳۰.۵ مگابایت (در قالب fp32) |
زبان | ترکی |
پشتیبانی از صدا | یک صدای ثابت |
نمونهبرداری پیشفرض | ۸ گام بهینهسازی (Refinement) |
محیط اجرای هدف | پردازنده (CPU)، کارت گرافیک (GPU) یا مرورگر |
مجوز | Apache 2.0 |
مدلی ۷.۶۲ میلیون پارامتری در جمع برترینها!
نتایج منتشرشده در ارزیابی Freya-TR-Eval نشان میدهد که Antalia-2 Mini از نظر معیارهای نرخ خطای کلمه (WER) و نرخ خطای کاراکتر (CER)، در ردیف دقیقترین سیستمهای پردازش گفتار ترکی قرار گرفته است. معیارهای WER و CER صدای تولیدشده توسط مدل را پس از پیادهسازی خودکار با متن اصلی مقایسه میکنند و درصد پایینتر در این بنچمارکها نشاندهنده خطای بسیار کمتر در تلفظ و تشخیص است.
نوع ارزیابی | نرخ خطای کلمه (WER) | نرخ خطای کاراکتر (CER) | جایگاه |
|---|---|---|---|
تنظیمات پیشفرض | ۰.۹۷٪ | ۰.۱۹٪ | همرتبه با EMA Lightning در WER؛ کمترین نرخ CER |
اجرای مجدد بنچمارک عمومی | ۱.۰۵٪ | ۰.۲۰٪ | رتبه دوم از میان ۱۵ مدل در WER؛ رتبه اول در CER |
در تکرار عمومی این بنچمارک، مدل Antalia-2 Mini تنها با اختلاف ۰.۰۱ واحد درصد نسبت به EMA Lightning در رده دوم WER قرار گرفت؛ تفاوتی بسیار ناچیز که سازندگان پروژه آن را ناشی از تغییرات تصادفی در مقدار اولیه (Seed) میدانند. جالبتر اینجاست که در همین جدول، نام مدلهای نامآشنایی مانند Trendyol-TTS با ۲.۳۸ میلیارد پارامتر، Anka TTS با ۳۳۶ میلیون پارامتر، Chatterbox Multilingual با ۵۰۰ میلیون پارامتر و حتی Gemini 3.8 Flash TTS به چشم میخورد که همگی خطای کاراکتر (CER) بیشتری را نسبت به این مدل سبک ۳۰ مگابایتی ثبت کردهاند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

اجرای هوش مصنوعی ویدیویی Wan 2.1 علیبابا روی کارتهای ۶ گیگابایتی با لانچر متنباز WanGP
استارتاپها و کاربران خانگی همیشه با مشکل حافظه کم کارت گرافیک برای اجرای مدلهای ویدیویی سنگین دستوپنجه نرم میکنند. حالا ابزار متنباز WanGP با بهینهسازی هوشمند و جابهجایی بار پردازشی میان VRAM و رم سیستم، امکان اجرای مدل ویدیویی پرطرفدار Wan 2.1 علیبابا را حتی روی کارتهای گرافیک ۶ و ۸ گیگابایتی فراهم کرده است.

مدیران ارشد دنیای فناوری: هوش مصنوعی صوتی هنوز به «لحظه شگفتانگیز ChatGPT» نرسیده است!
با وجود سرمایهگذاریهای میلیاردی روی هوش مصنوعی صوتی و معرفی مدلهای مکالمه دوطرفه، مدیران ارشد شرکتهای PolyAI و Otter معتقدند این فناوری هنوز به نقطه عطف و «لحظه ChatGPT» خود نرسیده است. به باور آنها، کندی استدلال در لحظه، خطاهای بازشناسی گفتار و نبود حس انسانی واقعی همچنان موانع اصلی اعتماد کاربران به دستیارهای صوتی به شمار میروند.

به پاسخهای هوش مصنوعی گوگل اعتمادی نیست؟ با این ۶ ترفند کاربردی مهارش کنید!
بخش خلاصه هوش مصنوعی گوگل (AI Overviews) چه بخواهیم و چه نخواهیم آمده است که بماند. اما بهجای کنار گذاشتن آن یا کلافه شدن از خطاهایش، با یادگیری چند ترفند ساده پرامپتنویسی میتوانید این ابزار را مهار کرده و دقیقترین اطلاعات را از دل جستوجو بیرون بکشید.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.