رونمایی از مدل متنباز VieNeu-TTS v3 Turbo؛ تولید صدای فوقالعاده باکیفیت ۴۸ کیلوهرتزی حتی روی پردازندههای معمولی!
مدل متنباز و سبک VieNeu-TTS v3 Turbo با تنها ۱۰۰ میلیون پارامتر از راه رسید تا امکان تولید صدای فوقالعاده باکیفیت ۴۸ کیلوهرتزی را حتی روی پردازندههای معمولی (CPU) فراهم کند. این مدل با حدود ۱۰ هزار ساعت داده صوتی آموزش دیده و علاوه بر تفکیک دقیق احساسات، از سوئیچ زبانی همزمان بین انگلیسی و ویتنامی نیز پشتیبانی میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل متنباز و سبک VieNeu-TTS v3 Turbo با تنها ۱۰۰ میلیون پارامتر منتشر شده و میتواند صداهایی فوقالعاده باکیفیت و ۴۸ کیلوهرتزی را حتی روی پردازندههای معمولی کامپیوتر بدون نیاز به کارت گرافیک اجرا کند.
- این مدل با حدود ۱۰ هزار ساعت داده صوتی انگلیسی و ویتنامی از پایه آموزش دیده و از قابلیتهایی مثل کلون کردن صدا، بیان احساسات و جابهجایی هوشمند بین دو زبان پشتیبانی میکند.
- پروژه مذکور در فرمتهای پرکاربردی مثل ONNX، Safetensors و GGUF عرضه شده، نزدیک به ۷۸۰ هزار بار در هاگینگفیس دانلود شده و تحت مجوز کاملاً آزاد Apache-2.0 در دسترس توسعهدهندگان است.
مدل VieNeu-TTS v3 Turbo؛ تولید صدای باکیفیت ۴۸ کیلوهرتزی حتی روی پردازندههای معمولی
مدل VieNeu-TTS v3 Turbo یک مدل متنباز تبدیل متن به گفتار (Text-to-Speech) است که خروجی صوتی شفاف ۴۸ کیلوهرتزی، شبیهسازی و کلون کردن صدا، سوئیچ روان بین زبانهای ویتنامی و انگلیسی، اعمال احساسات در کلام و یک رابط برنامهنویسی استریم سازگار با استاندارد OpenAI را ارائه میدهد. صفحه رسمی این مدل در پلتفرم هاگینگفیس (Hugging Face) نشان میدهد که این پروژه تاکنون نزدیک به ۷۸۰ هزار بار دانلود شده است.
توسعهدهندگان این پروژه، مدل v3 Turbo را یک معماری کاملاً اختصاصی و نوآورانه معرفی کردهاند که از پایه روی حدود ۱۰ هزار ساعت داده صوتی انگلیسی و ویتنامی آموزش دیده است. این مدل با حجم جمعوجور و تقریباً ۱۰۰ میلیون پارامتر، امکان اجرای مستقیم و روان روی پردازندههای معمولی (CPU) را به شما میدهد؛ در عین حال، برای سیستمهای مجهز به کارت گرافیک و پردازشهای سنگین هم یک مسیر اختصاصی با شتابدهنده CUDA فراهم کرده است. وزنهای مدل نیز با مجوز آزاد و تجاری Apache-2.0 منتشر شدهاند تا استفاده از آن برای همه رایگان و آسان باشد.
یک چکپوینت، دو محیط اجرایی مختلف
این نسخه یک چکپوینت واحد را در فرمتهای محبوب ONNX، Safetensors و GGUF به همراه یک کیت توسعه پایتون (SDK) به نام vieneu منتشر کرده است. جالب اینجاست که اجرای مدل روی CPU از طریق موتور ONNX Runtime و بدون نیاز به ایمپورت کتابخانه سنگین PyTorch انجام میشود؛ اما در سیستمهای دارای کارت گرافیک انویدیا (CUDA)، این SDK بهطور هوشمند موتور PyTorch را همراه با دستهبندی خودکار و زمانبندی پیوسته انتخاب میکند تا بیشترین بازدهی به دست بیاید. نکته جذاب برای برنامهنویسان این است که برای استفاده از هر دو محیط پردازشی، رابط کاربری و API کاملاً یکسانی در نظر گرفته شده است.
صداها، شبیهسازی و کنترل دقیق لحن
- صدای شفاف ۴۸ کیلوهرتزی: این مدل از کدک عصبی MOSS Audio Tokenizer بهره میبرد که نرخ نمونهبرداری خروجی را نسبت به نسل دوم (که ۲۴ کیلوهرتز بود) به دو برابر افزایش داده و کیفیتی کریستالی به صدا بخشیده است.
- ۲۳ صدای پیشفرض و متنوع: این پروژه دارای ۲۳ صدای آماده و متنوع است که لهجههای مختلف مناطق شمالی، مرکزی و جنوبی ویتنام را در قالب چندین شخصیت و سبک گویندگی متفاوت پوشش میدهد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

دوپامین مصنوعی و مغزهای هکشده؛ هوش مصنوعی مولد چطور سیمکشی تمرکز ما را به هم میریزد؟
رگبار نوتیفیکیشنها و سیستمهای هوش مصنوعی مولد با تولید مداوم «دوپامین مصنوعی»، ساختار شیمیایی و مدارهای تمرکز مغز انسان را دستخوش تغییر اساسی کردهاند. این سقوط دامنه توجه صرفاً یک مسئله شخصی نیست، بلکه با از بین بردن فرصتهای استراحت مغزی، امنیت شناختی و تفکر عمیق جامعه را در معرض تهدیدی جدی قرار داده است.

شتاب خیرهکننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکنها
تیم OpenBMB با انتشار مدل کمحجم ۳۲۴ میلیون پارامتری DSpark، جهش بزرگی در سرعت استنتاج مدل زبانی MiniCPM5-2B ایجاد کرده است. این مدل با تکیه بر تکنیک هوشمندانه رمزگشایی گمانهزنانه، توکنها را به صورت دستهای حدس میزند تا فرایند پردازش با کمترین مصرف محاسباتی و بیشترین سرعت ممکن اجرا شود.

پیودیپای: موقع ساخت هوش مصنوعی اختصاصیام، OpenAI دو بار اکانتم را بست!
فلیکس شلبرگ یا همان پیودیپای معروف، بهتازگی مدل هوش مصنوعی محلی خود به نام Ajax را معرفی کرده، اما فاش ساخته که در مسیر توسعه آن، شرکت OpenAI دو بار حسابش را مسدود کرده است. او برای ساخت این مدل ۹ میلیارد پارامتری از تکنیک تقطیر استفاده کرده؛ موضوعی که زنگ خطر نقض قوانین سازنده ChatGPT را به صدا درآورده است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.