شاهکار صوتی جدید انویدیا: مدل BigVGAN v2 با کیفیت استودیویی و سرعت ۳ برابری از راه رسید
انویدیا از نسخه دوم ووکودر هوش مصنوعی BigVGAN با پشتیبانی از کیفیت صوتی استودیویی ۴۴.۱ کیلوهرتز رونمایی کرد. این مدل هوشمند به لطف کرنلهای بهینهشده CUDA، پردازش صدا را تا ۳ برابر سریعتر انجام میدهد و تحولی چشمگیر در تبدیل متن به گفتار و تولید موسیقی ایجاد خواهد کرد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- انویدیا از مدل ووکودر پیشرفته BigVGAN v2 با پشتیبانی از خروجی صدای شفاف ۴۴.۱ کیلوهرتزی (کیفیت CD) رونمایی کرد.
- به لطف بهینهسازیهای اختصاصی CUDA، سرعت استنتاج این مدل روی شتابدهنده A100 تا ۳ برابر سریعتر از پایتورچ استاندارد شده است.
- نسخه پرچمدار با ۱۲۲ میلیون پارامتر روی حجم گستردهای از اصوات، موسیقی و گفتار چندزبانه آموزش دیده تا خطاهای صوتی را به حداقل برساند.
مدل BigVGAN v2 با پشتیبانی از کیفیت ۴۴.۱ کیلوهرتز و پردازش فوقسریع CUDA از راه رسید
شرکت انویدیا در بهروزرسانی جدید BigVGAN v2، مدلهای پیشآموزشدیدهای برای تولید خروجیهای صوتی با نرخ نمونهبرداری ۲۲.۰۵، ۲۴ و ۴۴.۱ کیلوهرتز عرضه کرده است. مدل پرچمدار این مجموعه میتواند اسپکتوگرامهای مل ۱۲۸ کاناله را مستقیماً به موجهای صوتی فوقالعاده باکیفیت ۴۴.۱ کیلوهرتزی تبدیل کند و برای هر فریم مل، ۵۱۲ نمونه موج صوتی بسازد. علاوه بر این، یک اکستنشن سفارشی در محیط CUDA توسعه داده شده که بلوکهای فعالساز ضد اعوجاج (Anti-aliased) را با نهایت سرعت پردازش میکند؛ جایی که بخش عمده بار محاسباتی ژنراتور قرار دارد.
یک ووکودر عصبی (Neural Vocoder) در واقع مسئول آخرین مرحله در پایپلاینهای تبدیل متن به گفتار، تولید هوشمند موسیقی، شبیهسازی صدا و تبدیل ویدیو به صوت است. این مدل نمایی فشرده از فرکانس و زمان موسوم به ملاسپکتوگرام را تحویل میگیرد و نمونههای صوتی خام نهایی را برای ذخیره یا پخش بازسازی میکند. به همین دلیل، سرعت پردازش و دقت بالای ووکودر مستقیماً روی تأخیر کل سیستم، شفافیت فرکانسهای بالا و حذف نویزهای مصنوعی اثر میگذارد.
آموزش روی دادههای وسیعتر در کنار کرنلهای یکپارچه محاسباتی
- عرضه در ۵ پیکربندی متنوع: چکپوینتهای منتشرشده از سوی انویدیا کیفیتهای ۲۲، ۲۴ و ۴۴ کیلوهرتز را با باندهای مل ۸۰، ۱۰۰ یا ۱۲۸ پوشش میدهند.
- سرعت سرسامآور اینفرِنس با CUDA: بر اساس گزارش انویدیا، پردازش بهینهشده روی یک کارت گرافیک واحد A100، در مقایسه با حالت پیشفرض PyTorch، بین ۱.۵ تا ۳ برابر سریعتر شده است.
- توابع هدف و لاسهای بازطراحیشده: در فرایند آموزش از یک تفکیککننده زیرباندی CQT چندمقیاسی به همراه تابع زیان ملاسپکتوگرام چندمقیاسی استفاده شده است.
- مجموعه دادههای غنیتر: انویدیا این نسخه را روی بانک عظیمی از گفتارهای چندزبانه، ترکهای موسیقی، صدای سازهای مختلف و اصوات محیطی آموزش داده است.
مدل باکیفیت ۴۴.۱ کیلوهرتزی با بیشنمونهبرداری ۵۱۲ برابری، حدود ۱۲۲ میلیون پارامتر دارد و طی ۵ میلیون گام بهینهسازی آموزش دیده است؛ در حالی که سایر مدلهای این سری حدود ۱۱۲ میلیون پارامتر دارند. البته توجه داشته باشید که جهش سرعت گزارششده توسط انویدیا مربوط به مسیر ژنراتور CUDA است و سرعت خروجی کل خط لوله به مراحل تولید اسپکتوگرام، جابهجایی داده و انکود نهایی فایل صوتی نیز وابسته خواهد بود.

برچسب های مرتبط
مطالب مرتبط و پیشنهادی

تبدیل صوت به متن با سرعت جت؛ نسخه بهینهشده ویسپر مدیوم ۲.۴ برابر سریعتر شد!
تیم سیسترن با تبدیل مدل ویسپر مدیوم اوپنایآی به موتور بهینهشده CTranslate2، ابزاری فوقالعاده سریع و سبک برای تبدیل صوت به متن عرضه کرد. این نسخه با پوشش ۹۹ زبان و شتاب ۲.۴ برابری، هزینه اجرای سرورها و مصرف حافظه گرافیکی را به کمترین میزان میرساند.

تبدیل ۳۵ میلیون کاربر پاور بیآی به برنامهنویس؛ نقشه مایکروسافت با ایجنتهای هوش مصنوعی!
مایکروسافت با یک تیر دو نشان زده و قابلیتهای توسعه اپلیکیشن و دیتابیس پلتفرم Fabric را به پاور بیآی آورده است. حالا بیش از ۳۵ میلیون کاربر تجاری این سرویس میتوانند به کمک ایجنتهای هوش مصنوعی و کیت Rayfin، داشبوردهای خود را بدون کدنویسی پیچیده به اپلیکیشنهای دیتامحور واقعی تبدیل کنند.

رونمایی از آنر مجیک ۹ پرو مکس؛ غول دوربین هالیوودی با پردازش هوش مصنوعی و باتری خارقالعاده
آنر با معرفی گوشی پرچمدار مجیک ۹ پرو مکس، استانداردهای عکاسی موبایل را حسابی جابهجا کرد. این غول تازه با همکاری شرکت نامآشنای دوربینهای هالیوودی یعنی Arri، تراشه تصویربرداری اختصاصی مبتنی بر هوش مصنوعی و یک باتری غولپیکر عرضه شده تا رقبای گردنکلفت بازار را به چالش بکشد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.