پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی از مدل متن‌باز VieNeu-TTS v3 Turbo؛ تولید صدای فوق‌العاده باکیفیت ۴۸ کیلوهرتزی حتی روی پردازنده‌های معمولی!

انتشار:۱۱ مهر ۱۴۰۵(۵ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

مدل متن‌باز و سبک VieNeu-TTS v3 Turbo با تنها ۱۰۰ میلیون پارامتر از راه رسید تا امکان تولید صدای فوق‌العاده باکیفیت ۴۸ کیلوهرتزی را حتی روی پردازنده‌های معمولی (CPU) فراهم کند. این مدل با حدود ۱۰ هزار ساعت داده صوتی آموزش دیده و علاوه بر تفکیک دقیق احساسات، از سوئیچ زبانی هم‌زمان بین انگلیسی و ویتنامی نیز پشتیبانی می‌کند.

رونمایی از مدل متن‌باز VieNeu-TTS v3 Turbo؛ تولید صدای فوق‌العاده باکیفیت ۴۸ کیلوهرتزی حتی روی پردازنده‌های معمولی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل متن‌باز و سبک VieNeu-TTS v3 Turbo با تنها ۱۰۰ میلیون پارامتر منتشر شده و می‌تواند صداهایی فوق‌العاده باکیفیت و ۴۸ کیلوهرتزی را حتی روی پردازنده‌های معمولی کامپیوتر بدون نیاز به کارت گرافیک اجرا کند.
  • این مدل با حدود ۱۰ هزار ساعت داده صوتی انگلیسی و ویتنامی از پایه آموزش دیده و از قابلیت‌هایی مثل کلون کردن صدا، بیان احساسات و جابه‌جایی هوشمند بین دو زبان پشتیبانی می‌کند.
  • پروژه مذکور در فرمت‌های پرکاربردی مثل ONNX، Safetensors و GGUF عرضه شده، نزدیک به ۷۸۰ هزار بار در هاگینگ‌فیس دانلود شده و تحت مجوز کاملاً آزاد Apache-2.0 در دسترس توسعه‌دهندگان است.

مدل VieNeu-TTS v3 Turbo؛ تولید صدای باکیفیت ۴۸ کیلوهرتزی حتی روی پردازنده‌های معمولی

مدل VieNeu-TTS v3 Turbo یک مدل متن‌باز تبدیل متن به گفتار (Text-to-Speech) است که خروجی صوتی شفاف ۴۸ کیلوهرتزی، شبیه‌سازی و کلون کردن صدا، سوئیچ روان بین زبان‌های ویتنامی و انگلیسی، اعمال احساسات در کلام و یک رابط برنامه‌نویسی استریم سازگار با استاندارد OpenAI را ارائه می‌دهد. صفحه رسمی این مدل در پلتفرم هاگینگ‌فیس (Hugging Face) نشان می‌دهد که این پروژه تاکنون نزدیک به ۷۸۰ هزار بار دانلود شده است.

توسعه‌دهندگان این پروژه، مدل v3 Turbo را یک معماری کاملاً اختصاصی و نوآورانه معرفی کرده‌اند که از پایه روی حدود ۱۰ هزار ساعت داده صوتی انگلیسی و ویتنامی آموزش دیده است. این مدل با حجم جمع‌وجور و تقریباً ۱۰۰ میلیون پارامتر، امکان اجرای مستقیم و روان روی پردازنده‌های معمولی (CPU) را به شما می‌دهد؛ در عین حال، برای سیستم‌های مجهز به کارت گرافیک و پردازش‌های سنگین هم یک مسیر اختصاصی با شتاب‌دهنده CUDA فراهم کرده است. وزن‌های مدل نیز با مجوز آزاد و تجاری Apache-2.0 منتشر شده‌اند تا استفاده از آن برای همه رایگان و آسان باشد.

یک چک‌پوینت، دو محیط اجرایی مختلف

این نسخه یک چک‌پوینت واحد را در فرمت‌های محبوب ONNX، Safetensors و GGUF به همراه یک کیت توسعه پایتون (SDK) به نام vieneu منتشر کرده است. جالب اینجاست که اجرای مدل روی CPU از طریق موتور ONNX Runtime و بدون نیاز به ایمپورت کتابخانه سنگین PyTorch انجام می‌شود؛ اما در سیستم‌های دارای کارت گرافیک انویدیا (CUDA)، این SDK به‌طور هوشمند موتور PyTorch را همراه با دسته‌بندی خودکار و زمان‌بندی پیوسته انتخاب می‌کند تا بیش‌ترین بازدهی به دست بیاید. نکته جذاب برای برنامه‌نویسان این است که برای استفاده از هر دو محیط پردازشی، رابط کاربری و API کاملاً یکسانی در نظر گرفته شده است.

صداها، شبیه‌سازی و کنترل دقیق لحن

  • صدای شفاف ۴۸ کیلوهرتزی: این مدل از کدک عصبی MOSS Audio Tokenizer بهره می‌برد که نرخ نمونه‌برداری خروجی را نسبت به نسل دوم (که ۲۴ کیلوهرتز بود) به دو برابر افزایش داده و کیفیتی کریستالی به صدا بخشیده است.
  • ۲۳ صدای پیش‌فرض و متنوع: این پروژه دارای ۲۳ صدای آماده و متنوع است که لهجه‌های مختلف مناطق شمالی، مرکزی و جنوبی ویتنام را در قالب چندین شخصیت و سبک گویندگی متفاوت پوشش می‌دهد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

دوپامین مصنوعی و مغزهای هک‌شده؛ هوش مصنوعی مولد چطور سیم‌کشی تمرکز ما را به هم می‌ریزد؟
آخرین اخبار

دوپامین مصنوعی و مغزهای هک‌شده؛ هوش مصنوعی مولد چطور سیم‌کشی تمرکز ما را به هم می‌ریزد؟

رگبار نوتیفیکیشن‌ها و سیستم‌های هوش مصنوعی مولد با تولید مداوم «دوپامین مصنوعی»، ساختار شیمیایی و مدارهای تمرکز مغز انسان را دستخوش تغییر اساسی کرده‌اند. این سقوط دامنه توجه صرفاً یک مسئله شخصی نیست، بلکه با از بین بردن فرصت‌های استراحت مغزی، امنیت شناختی و تفکر عمیق جامعه را در معرض تهدیدی جدی قرار داده است.

۶ دقیقه مطالعه
۰
۱۱ مهر
شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها
آخرین اخبار

شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها

تیم OpenBMB با انتشار مدل کم‌حجم ۳۲۴ میلیون پارامتری DSpark، جهش بزرگی در سرعت استنتاج مدل زبانی MiniCPM5-2B ایجاد کرده است. این مدل با تکیه بر تکنیک هوشمندانه رمزگشایی گمانه‌زنانه، توکن‌ها را به صورت دسته‌ای حدس می‌زند تا فرایند پردازش با کم‌ترین مصرف محاسباتی و بیش‌ترین سرعت ممکن اجرا شود.

۲ دقیقه مطالعه
۰
۱۱ مهر
پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!
آخرین اخبار

پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!

فلیکس شلبرگ یا همان پیودی‌پای معروف، به‌تازگی مدل هوش مصنوعی محلی خود به نام Ajax را معرفی کرده، اما فاش ساخته که در مسیر توسعه آن، شرکت OpenAI دو بار حسابش را مسدود کرده است. او برای ساخت این مدل ۹ میلیارد پارامتری از تکنیک تقطیر استفاده کرده؛ موضوعی که زنگ خطر نقض قوانین سازنده ChatGPT را به صدا درآورده است.

۳ دقیقه مطالعه
۰
۱۱ مهر