پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار صوتی جدید انویدیا: مدل BigVGAN v2 با کیفیت استودیویی و سرعت ۳ برابری از راه رسید

انتشار:۷ مهر ۱۴۰۵(۵۶ دقیقه پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

انویدیا از نسخه دوم ووکودر هوش مصنوعی BigVGAN با پشتیبانی از کیفیت صوتی استودیویی ۴۴.۱ کیلوهرتز رونمایی کرد. این مدل هوشمند به لطف کرنل‌های بهینه‌شده CUDA، پردازش صدا را تا ۳ برابر سریع‌تر انجام می‌دهد و تحولی چشمگیر در تبدیل متن به گفتار و تولید موسیقی ایجاد خواهد کرد.

شاهکار صوتی جدید انویدیا: مدل BigVGAN v2 با کیفیت استودیویی و سرعت ۳ برابری از راه رسید

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • انویدیا از مدل ووکودر پیشرفته BigVGAN v2 با پشتیبانی از خروجی صدای شفاف ۴۴.۱ کیلوهرتزی (کیفیت CD) رونمایی کرد.
  • به لطف بهینه‌سازی‌های اختصاصی CUDA، سرعت استنتاج این مدل روی شتاب‌دهنده A100 تا ۳ برابر سریع‌تر از پای‌تورچ استاندارد شده است.
  • نسخه پرچمدار با ۱۲۲ میلیون پارامتر روی حجم گسترده‌ای از اصوات، موسیقی و گفتار چندزبانه آموزش دیده تا خطاهای صوتی را به حداقل برساند.

مدل BigVGAN v2 با پشتیبانی از کیفیت ۴۴.۱ کیلوهرتز و پردازش فوق‌سریع CUDA از راه رسید

شرکت انویدیا در به‌روزرسانی جدید BigVGAN v2، مدل‌های پیش‌آموزش‌دیده‌ای برای تولید خروجی‌های صوتی با نرخ نمونه‌برداری ۲۲.۰۵، ۲۴ و ۴۴.۱ کیلوهرتز عرضه کرده است. مدل پرچمدار این مجموعه می‌تواند اسپکتوگرام‌های مل ۱۲۸ کاناله را مستقیماً به موج‌های صوتی فوق‌العاده باکیفیت ۴۴.۱ کیلوهرتزی تبدیل کند و برای هر فریم مل، ۵۱۲ نمونه موج صوتی بسازد. علاوه بر این، یک اکستنشن سفارشی در محیط CUDA توسعه داده شده که بلوک‌های فعال‌ساز ضد اعوجاج (Anti-aliased) را با نهایت سرعت پردازش می‌کند؛ جایی که بخش عمده بار محاسباتی ژنراتور قرار دارد.

یک ووکودر عصبی (Neural Vocoder) در واقع مسئول آخرین مرحله در پایپ‌لاین‌های تبدیل متن به گفتار، تولید هوشمند موسیقی، شبیه‌سازی صدا و تبدیل ویدیو به صوت است. این مدل نمایی فشرده از فرکانس و زمان موسوم به مل‌اسپکتوگرام را تحویل می‌گیرد و نمونه‌های صوتی خام نهایی را برای ذخیره یا پخش بازسازی می‌کند. به همین دلیل، سرعت پردازش و دقت بالای ووکودر مستقیماً روی تأخیر کل سیستم، شفافیت فرکانس‌های بالا و حذف نویزهای مصنوعی اثر می‌گذارد.

آموزش روی داده‌های وسیع‌تر در کنار کرنل‌های یکپارچه محاسباتی

  • عرضه در ۵ پیکربندی متنوع: چک‌پوینت‌های منتشرشده از سوی انویدیا کیفیت‌های ۲۲، ۲۴ و ۴۴ کیلوهرتز را با باندهای مل ۸۰، ۱۰۰ یا ۱۲۸ پوشش می‌دهند.
  • سرعت سرسام‌آور اینفرِنس با CUDA: بر اساس گزارش انویدیا، پردازش بهینه‌شده روی یک کارت گرافیک واحد A100، در مقایسه با حالت پیش‌فرض PyTorch، بین ۱.۵ تا ۳ برابر سریع‌تر شده است.
  • توابع هدف و لاس‌های بازطراحی‌شده: در فرایند آموزش از یک تفکیک‌کننده زیرباندی CQT چندمقیاسی به همراه تابع زیان مل‌اسپکتوگرام چندمقیاسی استفاده شده است.
  • مجموعه داده‌های غنی‌تر: انویدیا این نسخه را روی بانک عظیمی از گفتارهای چندزبانه، ترک‌های موسیقی، صدای سازهای مختلف و اصوات محیطی آموزش داده است.

مدل باکیفیت ۴۴.۱ کیلوهرتزی با بیش‌نمونه‌برداری ۵۱۲ برابری، حدود ۱۲۲ میلیون پارامتر دارد و طی ۵ میلیون گام بهینه‌سازی آموزش دیده است؛ در حالی که سایر مدل‌های این سری حدود ۱۱۲ میلیون پارامتر دارند. البته توجه داشته باشید که جهش سرعت گزارش‌شده توسط انویدیا مربوط به مسیر ژنراتور CUDA است و سرعت خروجی کل خط لوله به مراحل تولید اسپکتوگرام، جابه‌جایی داده و انکود نهایی فایل صوتی نیز وابسته خواهد بود.

معماری ژنراتور مدل صوتی BigVGAN انویدیا
معماری ژنراتور BigVGAN از آپ‌سمپلینگ فیلترشده و توابع فعال‌ساز دوره‌ای برای بازسازی دقیق موج صوتی و جلوگیری از نویزهای نامطلوب استفاده می‌کند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

تبدیل صوت به متن با سرعت جت؛ نسخه بهینه‌شده ویسپر مدیوم ۲.۴ برابر سریع‌تر شد!
آخرین اخبار

تبدیل صوت به متن با سرعت جت؛ نسخه بهینه‌شده ویسپر مدیوم ۲.۴ برابر سریع‌تر شد!

تیم سیسترن با تبدیل مدل ویسپر مدیوم اوپن‌ای‌آی به موتور بهینه‌شده CTranslate2، ابزاری فوق‌العاده سریع و سبک برای تبدیل صوت به متن عرضه کرد. این نسخه با پوشش ۹۹ زبان و شتاب ۲.۴ برابری، هزینه اجرای سرورها و مصرف حافظه گرافیکی را به کمترین میزان می‌رساند.

۲ دقیقه مطالعه
۰
۷ مهر
تبدیل ۳۵ میلیون کاربر پاور بی‌آی به برنامه‌نویس؛ نقشه مایکروسافت با ایجنت‌های هوش مصنوعی!
آخرین اخبار

تبدیل ۳۵ میلیون کاربر پاور بی‌آی به برنامه‌نویس؛ نقشه مایکروسافت با ایجنت‌های هوش مصنوعی!

مایکروسافت با یک تیر دو نشان زده و قابلیت‌های توسعه اپلیکیشن و دیتابیس پلتفرم Fabric را به پاور بی‌آی آورده است. حالا بیش از ۳۵ میلیون کاربر تجاری این سرویس می‌توانند به کمک ایجنت‌های هوش مصنوعی و کیت Rayfin، داشبوردهای خود را بدون کدنویسی پیچیده به اپلیکیشن‌های دیتامحور واقعی تبدیل کنند.

۳ دقیقه مطالعه
۰
۷ مهر
رونمایی از آنر مجیک ۹ پرو مکس؛ غول دوربین هالیوودی با پردازش هوش مصنوعی و باتری خارق‌العاده
آخرین اخبار

رونمایی از آنر مجیک ۹ پرو مکس؛ غول دوربین هالیوودی با پردازش هوش مصنوعی و باتری خارق‌العاده

آنر با معرفی گوشی پرچمدار مجیک ۹ پرو مکس، استانداردهای عکاسی موبایل را حسابی جابه‌جا کرد. این غول تازه با همکاری شرکت نام‌آشنای دوربین‌های هالیوودی یعنی Arri، تراشه تصویربرداری اختصاصی مبتنی بر هوش مصنوعی و یک باتری غول‌پیکر عرضه شده تا رقبای گردن‌کلفت بازار را به چالش بکشد.

۶ دقیقه مطالعه
۰
۷ مهر