پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شگفتی مدل ۳۰ مگابایتی Antalia-2 Mini: شکست غول‌های چند میلیاردی در تبدیل متن به گفتار ترکی!

انتشار:۱۹ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه
اشتراک و پسندیدن

تیم هوش مصنوعی PatientDesk با معرفی مدل Antalia-2 Mini نشان داد که برای دستیابی به خروجی صوتی باکیفیت همیشه نیازی به مدل‌های سنگین نیست؛ این مدل متن‌باز ترکی با حجم باورنکردنی ۳۰ مگابایت حتی روی پردازنده‌های معمولی (CPU) اجرا می‌شود. نتایج بررسی‌ها نشان می‌دهد که این مدل فوق‌العاده سبک با کنار زدن مدل‌های چند میلیارد پارامتری، دقت شگفت‌انگیزی را در تبدیل متن به گفتار به نمایش گذاشته است.

شگفتی مدل ۳۰ مگابایتی Antalia-2 Mini: شکست غول‌های چند میلیاردی در تبدیل متن به گفتار ترکی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل صوتی Antalia-2 Mini با تنها ۷.۶۲ میلیون پارامتر و حجم ۳۰.۵ مگابایتی منتشر شده و به لطف مجوز متن‌باز Apache 2.0، امکان اجرای محلی روی پردازنده‌های معمولی (CPU) و حتی مرورگر را فراهم می‌کند.
  • سازندگان این مدل برای ثبت بیش‌ترین سرعت و کم‌ترین تأخیر، پیچیدگی‌های چندزبانه را کنار گذاشته و کل معماری را به‌طور اختصاصی روی یک زبان (ترکی) و یک صدای ثابت متمرکز کرده‌اند.
  • در تست‌های استاندارد Freya-TR-Eval، این مدل جمع‌وجور با ثبت خطای کاراکتر فوق‌العاده پایین (۰.۱۹٪)، عملکردی دقیق‌تر از غول‌های چند میلیارد پارامتری مانند Trendyol-TTS و حتی جمینای ثبت کرده است.

اجرای تبدیل متن به گفتار ترکی روی CPU با مدل سبک Antalia-2 Mini

مدل Antalia-2 Mini یک مدل متن‌باز تبدیل متن به گفتار (TTS) برای زبان ترکی است که به‌طور ویژه برای پردازش محلی و بدون نیاز به کارت گرافیک (فقط با اتکا به CPU) توسعه پیدا کرده است. این مدل جمع‌وجور با دارا بودن تنها ۷.۶۲ میلیون پارامتر، در قالب fp32 فقط ۳۰.۵ مگابایت فضا اشغال می‌کند. خبر خوب برای جامعه متن‌باز این است که وزن‌های مدل، ابزار نرمال‌سازی متن و کل فرآیند آموزش آن تحت مجوز کاملاً آزاد Apache 2.0 در دسترس همگان قرار گرفته است.

تا پیش از این، توسعه‌دهندگان زبان ترکی همیشه سر یک دوراهی سخت قرار داشتند: یا باید سراغ ای‌پی‌آی‌های ابری و پرهزینه می‌رفتند، یا مدل‌های چندزبانه و غول‌پیکر چند گیگابایتی را دانلود می‌کردند، یا اینکه به سیستم‌های کوچک اما پر از خطای تلفظ رضایت می‌دادند. حالا Antalia-2 Mini با یک فرمول هوشمندانه وارد میدان شده است؛ این مدل تنوع زبانی و صداهای گوناگون را کنار گذاشته و تمام تمرکزش را روی یک زبان و یک صدای ثابت جمع کرده تا در ازای آن، سرعت بالا، تأخیر فوق‌العاده کم و حجم بسیار سبکی را به ارمغان بیاورد.

تعداد پارامترها
۷.۶۲ میلیون
حجم وزن‌ها
۳۰.۵ مگابایت (در قالب fp32)
زبان
ترکی
پشتیبانی از صدا
یک صدای ثابت
نمونه‌برداری پیش‌فرض
۸ گام بهینه‌سازی (Refinement)
محیط اجرای هدف
پردازنده (CPU)، کارت گرافیک (GPU) یا مرورگر
مجوز
Apache 2.0

مدلی ۷.۶۲ میلیون پارامتری در جمع برترین‌ها!

نتایج منتشرشده در ارزیابی Freya-TR-Eval نشان می‌دهد که Antalia-2 Mini از نظر معیارهای نرخ خطای کلمه (WER) و نرخ خطای کاراکتر (CER)، در ردیف دقیق‌ترین سیستم‌های پردازش گفتار ترکی قرار گرفته است. معیارهای WER و CER صدای تولیدشده توسط مدل را پس از پیاده‌سازی خودکار با متن اصلی مقایسه می‌کنند و درصد پایین‌تر در این بنچمارک‌ها نشان‌دهنده خطای بسیار کم‌تر در تلفظ و تشخیص است.

نوع ارزیابی
نرخ خطای کلمه (WER)
نرخ خطای کاراکتر (CER)
جایگاه
تنظیمات پیش‌فرض
۰.۹۷٪
۰.۱۹٪
هم‌رتبه با EMA Lightning در WER؛ کم‌ترین نرخ CER
اجرای مجدد بنچمارک عمومی
۱.۰۵٪
۰.۲۰٪
رتبه دوم از میان ۱۵ مدل در WER؛ رتبه اول در CER

در تکرار عمومی این بنچمارک، مدل Antalia-2 Mini تنها با اختلاف ۰.۰۱ واحد درصد نسبت به EMA Lightning در رده دوم WER قرار گرفت؛ تفاوتی بسیار ناچیز که سازندگان پروژه آن را ناشی از تغییرات تصادفی در مقدار اولیه (Seed) می‌دانند. جالب‌تر اینجاست که در همین جدول، نام مدل‌های نام‌آشنایی مانند Trendyol-TTS با ۲.۳۸ میلیارد پارامتر، Anka TTS با ۳۳۶ میلیون پارامتر، Chatterbox Multilingual با ۵۰۰ میلیون پارامتر و حتی Gemini 3.8 Flash TTS به چشم می‌خورد که همگی خطای کاراکتر (CER) بیشتری را نسبت به این مدل سبک ۳۰ مگابایتی ثبت کرده‌اند.

بازخورد و اشتراک‌گذاری این مطلب

اگر این گزارش برایتان مفید بود، با پسندیدن و اشتراک‌گذاری آن با دیگران، از محتوای تخصصی هوش مصنوعی حمایت کنید.

اشتراک‌گذاری در شبکه‌های اجتماعی:

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

اجرای هوش مصنوعی ویدیویی Wan 2.1 علی‌بابا روی کارت‌های ۶ گیگابایتی با لانچر متن‌باز WanGP
آخرین اخبار

اجرای هوش مصنوعی ویدیویی Wan 2.1 علی‌بابا روی کارت‌های ۶ گیگابایتی با لانچر متن‌باز WanGP

استارتاپ‌ها و کاربران خانگی همیشه با مشکل حافظه کم کارت گرافیک برای اجرای مدل‌های ویدیویی سنگین دست‌وپنجه نرم می‌کنند. حالا ابزار متن‌باز WanGP با بهینه‌سازی هوشمند و جابه‌جایی بار پردازشی میان VRAM و رم سیستم، امکان اجرای مدل ویدیویی پرطرفدار Wan 2.1 علی‌بابا را حتی روی کارت‌های گرافیک ۶ و ۸ گیگابایتی فراهم کرده است.

۲ دقیقه مطالعه
۰
۱۹ مهر
مدیران ارشد دنیای فناوری: هوش مصنوعی صوتی هنوز به «لحظه شگفت‌انگیز ChatGPT» نرسیده است!
آخرین اخبار

مدیران ارشد دنیای فناوری: هوش مصنوعی صوتی هنوز به «لحظه شگفت‌انگیز ChatGPT» نرسیده است!

با وجود سرمایه‌گذاری‌های میلیاردی روی هوش مصنوعی صوتی و معرفی مدل‌های مکالمه دوطرفه، مدیران ارشد شرکت‌های PolyAI و Otter معتقدند این فناوری هنوز به نقطه عطف و «لحظه ChatGPT» خود نرسیده است. به باور آن‌ها، کندی استدلال در لحظه، خطاهای بازشناسی گفتار و نبود حس انسانی واقعی همچنان موانع اصلی اعتماد کاربران به دستیارهای صوتی به شمار می‌روند.

۴ دقیقه مطالعه
۰
۱۹ مهر
به پاسخ‌های هوش مصنوعی گوگل اعتمادی نیست؟ با این ۶ ترفند کاربردی مهارش کنید!
آخرین اخبار

به پاسخ‌های هوش مصنوعی گوگل اعتمادی نیست؟ با این ۶ ترفند کاربردی مهارش کنید!

بخش خلاصه هوش مصنوعی گوگل (AI Overviews) چه بخواهیم و چه نخواهیم آمده است که بماند. اما به‌جای کنار گذاشتن آن یا کلافه شدن از خطاهایش، با یادگیری چند ترفند ساده پرامپت‌نویسی می‌توانید این ابزار را مهار کرده و دقیق‌ترین اطلاعات را از دل جست‌وجو بیرون بکشید.

۷ دقیقه مطالعه
۰
۱۹ مهر