پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل Nemotron 3 شرکت NVIDIA با ثبت خطای ۱۴.۷۲ درصدی ۱۲ رقیب خود را شکست داد

انتشار:۱ مهر ۱۴۰۵(۴ روز پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

شرکت NVIDIA از مدل متن‌باز ۱۰۰ میلیون پارامتری Nemotron 3 Diarization رونمایی کرد که توانایی تشخیص و تفکیک صدای تا ۸ گوینده مختلف را در فایل‌های صوتی دارد.

مدل Nemotron 3 شرکت NVIDIA با ثبت خطای ۱۴.۷۲ درصدی ۱۲ رقیب خود را شکست داد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل جدید Nemotron 3 با ۱۰۰ میلیون پارامتر، توانایی تفکیک همزمان صدای ۸ گوینده را در جریان‌های صوتی زنده و آفلاین دارد.
  • این مدل در بنچمارک‌های تخصصی با ثبت خطای ۱۴.۷۲ درصد، برتری قابل‌توجهی نسبت به رقبا به دست آورده است.
  • حذف نیاز به تطبیق دستی کانال‌ها و امکان تنظیم میزان تأخیر در حین استنتاج، از مهم‌ترین ویژگی‌های این مدل برای توسعه‌دهندگان است.

مدل ۱۰۰ میلیون پارامتری Nemotron 3 شرکت NVIDIA برای تفکیک صدای زنده

شرکت NVIDIA مدل Nemotron 3 Diarization را منتشر کرده است؛ یک مدل ۱۰۰ میلیون پارامتری که می‌تواند زمان صحبت کردن هر شخص را در فایل‌های صوتی ضبط‌شده یا زنده تشخیص دهد. این مدل با وزن‌های باز (open-weight) از استنتاج آفلاین و زنده (streaming)، همپوشانی گفتار و پشتیبانی از حداکثر ۸ گوینده پشتیبانی می‌کند. همچنین دمو این مدل در پلتفرم Hugging Face در دسترس قرار گرفته است.

نتایج اولیه بنچمارک Diarization-Bench نشان می‌دهد که این مدل در میان ۱۲ سیستم و ۱۷ پیکربندی مختلف روی ۱۳۹ مکالمه انگلیسی (در مجموع حدود ۲۲ ساعت) در رتبه نخست قرار گرفته است. مدل Nemotron نرخ خطای تفکیک (DER) معادل ۱۴.۷۲ درصد را ثبت کرد که در مقایسه با نرخ ۱۹.۳ درصدی بهترین پیکربندی بعدی، نشان‌دهنده کاهش نسبی ۲۳.۷ درصدی است. این بنچمارک همپوشانی گفتار را نیز در نظر گرفته و بدون هیچ حاشیه خطایی (boundary collar) ارزیابی شده است، به این معنی که هیچ‌گونه تلورانسی برای زمان جابجایی بین گویندگان در نظر گرفته نشده است.

برچسب‌گذاری گویندگان در بازه‌های ۸۰ میلی‌ثانیه‌ای

سیستم تفکیک گوینده به هر فردی که صحبت می‌کند یک برچسب و توالی‌ای از بازه‌های زمانی اختصاص می‌دهد. این بازه‌ها می‌توانند با برچسب‌های زمانی کلمات از یک مدل تشخیص خودکار گفتار ترکیب شوند تا متنی دقیق با ذکر نام گوینده تولید کنند. معیار DER سهمی از زمان صحبت گویندگان را که دچار تشخیص ازدست‌رفته، تشخیص اشتباه یا انتساب به گوینده نادرست شده است اندازه‌گیری می‌کند، بنابراین مقادیر کمتر نشان‌دهنده عملکرد بهتر است.

یک سیستم تفکیک صدای زنده، قطعات کوچک صوتی را با دسترسی محدود به زمینه اطراف آن دریافت می‌کند. این سیستم باید انتساب گویندگان را بین قطعات مختلف حفظ کند، حتی پس از وقفه‌ها و پریدن در حرف یکدیگر. اگر این تطبیق دچار مشکل شود، ممکن است یک فرد در یک قطعه به عنوان speaker_1 و در قطعه بعدی به عنوان speaker_2 شناخته شود که این امر باعث خراب شدن متن پیاده‌سازی‌شده و خلاصه‌های نهایی می‌شود.

ترتیب ورود از تغییر برچسب‌ها جلوگیری می‌کند

مدل Nemotron از رویکرد Sortformer استفاده می‌کند که گویندگان را بر اساس اولین باری که صحبت می‌کنند مرتب می‌کند. اولین صدای تشخیص‌داده‌شده کانال یک را اشغال می‌کند، صدای جدید بعدی در کانال دو قرار می‌گیرد و صداهای بعدی نیز از همین قانون پیروی می‌کنند. این مرتب‌سازی پایدار، نیاز به تطبیق مجدد و تصادفی کانال‌های خروجی برای هر قطعه را از بین می‌برد.

این مدل فایل‌های صوتی مونو ۱۶ کیلوهرتز را دریافت کرده و آن‌ها را در بازه‌های ۱۰ میلی‌ثانیه‌ای به ویژگی‌های Mel-spectrogram (نمایشی زمان-فرکانس از سیگنال) تبدیل می‌کند. سپس هشت فریم ویژگی را در یک فریم رمزگذار ۸۰ میلی‌ثانیه‌ای ترکیب کرده و آن‌ها را با استفاده از یک Transformer دارای ۳۱ لایه و تعبیه‌های موقعیتی چرخشی برای حفظ ترتیب فریم‌ها پردازش می‌کند.

خروجی پیش‌فرض یک تنسور ممیز شناور [T, 8] است که شامل احتمال فعالیت برای هر کانال گوینده در هر مرحله زمانی است. کانال‌های مستقل اجازه می‌دهند چندین گوینده به طور همزمان در یک فریم فعال باشند. استنتاج زنده، پیوستگی را از طریق سه ساختار حافظه حفظ می‌کند:

  • حافظه پنهان گویندگان بر اساس ترتیب ورود: اطلاعات مربوط به گویندگان را از قطعات قبلی نگه می‌دارد و آن‌ها را به کانال‌های ترتیب‌بندی‌شده متصل می‌کند.
  • صف زمینه FIFO: فریم‌های اخیری که بلافاصله قبل از قطعه فعلی قرار دارند را فراهم می‌کند.
  • بافر زمینه راست: مقدار کمی از صوت آینده را برای رفع ابهام تغییر گوینده اضافه می‌کند که باعث افزایش تأخیر بافر ورودی در ازای دسترسی به زمینه بیشتر می‌شود.

تنظیم تأخیر در زمان استنتاج

این مدل چهار پروفایل بافر پیشنهادی را در اختیار قرار می‌دهد که به برنامه‌ها اجازه می‌دهد بدون نیاز به آموزش مجدد مدل، تعادل میان تأخیر و دقت را انتخاب کنند.

پروفایل
تأخیر بافر ورودی
طول قطعه
زمینه راست
زمینه بالا
۳۰.۴ ثانیه
۳۴۰ فریم، ۲۷.۲ ثانیه
۴۰ فریم، ۳.۲ ثانیه
تأخیر پایین
۱.۰۴ ثانیه
۹ فریم، ۰.۷۲ ثانیه
۴ فریم، ۰.۳۲ ثانیه
تأخیر بسیار پایین
۰.۶۴ ثانیه
۶ فریم، ۰.۴۸ ثانیه
۲ فریم، ۰.۱۶ ثانیه
تأخیر فوق‌العاده پایین
۰.۳۲ ثانیه
۳ فریم، ۰.۲۴ ثانیه
۱ فریم، ۰.۰۸ ثانیه

تأخیر بافر ورودی برابر با (chunk_len + right_context) × 80 ms است. ارقام منتشرشده شامل زمان اجرای مدل، انتقال شبکه، ضبط صدا و تشخیص گفتار نهایی نمی‌شوند.

دستاوردها فراتر از بنچمارک اصلی

بر اساس گزارش‌های منتشرشده، مدل Nemotron با نسخه پایه چهار-گوینده قبلی خود مقایسه شده است. در تنظیمات ۱.۰۴ ثانیه‌ای، مدل جدید نرخ خطا (DER) را در هر هشت شرایط ارزیابی گزارش‌شده کاهش می‌دهد. کاهش‌های نسبی از ۹.۰ درصد در CALLHOME-Part2 تا ۶۵.۲ درصد در NOTSOFAR1 MHM متغیر است. میانگین گزارش‌شده ۴۱.۰ درصدی به هر مجموعه داده وزن یکسانی می‌دهد.

آزمون توان عملیاتی نشان می‌دهد که پردازش در زمان واقعی با اندازه دسته ۳۲ و استفاده از torch.compile() به ۱۵٬۱۱۳ برابر رسیده است، در حالی که این رقم برای مدل قبلی ۲٬۶۱۹ برابر بود. این میزان حدود ۵.۸ برابر توان عملیاتی نسخه پایه روی یک کارت گرافیک RTX PRO 5000 است. در همین مقایسه، خطای مجموعه داده DIHARD III از ۱۹.۰۹ درصد به ۱۲.۷۳ درصد کاهش یافته است.

پشتیبانی از هشت گوینده، بیشترین پیشرفت را در زیرمجموعه‌هایی با تعداد گویندگان زیاد نشان می‌دهد. این شرایط، محدودیت چهار-گوینده ثابت در مدل‌های قبلی را به خوبی مشخص می‌کند.

مواردی که دقت مدل کاهش می‌یابد

  • کانال‌های ناشناس: برچسب‌هایی مانند speaker_2 تنها صداها را در یک فایل پیگیری می‌کنند. اختصاص دادن نام واقعی نیازمند دسترسی به متادیتا یا یک سیستم مجزا برای تأیید هویت گوینده است.
  • محدودیت هشت-گوینده: فایل‌های صوتی با بیش از هشت شرکت‌کننده می‌توانند منجر به از دست رفتن برخی مکالمات یا انتساب اشتباه کانال‌ها شوند.
  • حساسیت آکوستیک: عواملی مانند نویز، بازتاب شدید صدا، میکروفون‌های دوردست، تغییرات محیطی و مکالمات طولانی می‌توانند باعث افزایش تشخیص‌های ازدست‌رفته، هشدارهای اشتباه، خطاهای مرزی و اشتباه گرفتن گویندگان شوند.
  • محدوده زبان انگلیسی در بنچمارک‌ها: نتایج اصلی بنچمارک‌ها مربوط به مکالمات انگلیسی است و تضمینی برای دقت مشابه در سایر زبان‌ها ارائه نمی‌دهد.
  • افت در مکالمات دو نفره: در زیرمجموعه دوگوینده CALLHOME، مدل Nemotron خطای ۵.۹۸ درصدی ثبت کرده است، در حالی که این رقم برای مدل پایه قبلی معادل ۵.۶۸ درصد بود.

اجرای پروفایل زمینه بالا در NeMo

from nemo.collections.asr.models import SortformerEncLabelModel

diar_model = SortformerEncLabelModel.from_pretrained(
    \"nvidia/Nemotron-3-Diarization\"
)
diar_model.eval()

diar_model.sortformer_modules.spkcache_len = 264
diar_model.sortformer_modules.fifo_len = 40
diar_model.sortformer_modules.chunk_len = 340
diar_model.sortformer_modules.chunk_right_context = 40
diar_model.sortformer_modules.spkcache_update_period = 300
diar_model._check_streaming_parameters()

predicted_segments = diar_model.diarize(
    audio=[\"/path/to/conversation.wav\"],
    batch_size=1,
)

مقادیر قطعه و زمینه راست در این مثال، بافر ورودی ۳۰.۴ ثانیه‌ای تولید می‌کنند. این روش قطعات زمان‌بندی‌شده را در قالب رشته‌های start end speaker_id بازمی‌گرداند.

فریم‌ورک NeMo می‌تواند یک مسیر صوتی، لیستی از مسیرها، آرایه‌های NumPy یا یک فایل JSON را به عنوان ورودی بپذیرد. فرمت‌های پشتیبانی‌شده شامل فایل‌های تک‌کاناله ۱۶ کیلوهرتز نظیر .wav، .flac، .opus و .mp3 هستند.

یک مدل تشخیص خودکار گفتار با برچسب زمانی کلمات می‌تواند متن مکالمه را فراهم کند. سپس یک برنامه می‌تواند هر کلمه یا قطعه را با بازه‌های زمانی گویندگان فعال مدل Nemotron همگام‌سازی کند تا یک متن پیاده‌سازی‌شده و تفکیک‌شده ساخته شود.

تنظیمات استقرار منتشرشده برای سیستم‌عامل لینوکس و کارت‌های گرافیک شرکت NVIDIA بهینه‌سازی شده‌اند. وزن‌های این مدل تحت مجوز باز منتشر شده است.

زیرساخت پردازش صدای سبک‌تر

دستیارهای جلسات، سیستم‌های تحلیل تماس، ابزارهای پادکست و ایجنت‌های صوتی چندنفره به انتساب دقیق صداها وابسته‌اند، زیرا خطاهای تشخیص گوینده به خلاصه‌ها و نمایه‌های جستجو منتقل می‌شوند. مدل Nemotron به این برنامه‌ها یک ساختار واحد برای صداهای زنده و ضبط‌شده ارائه می‌دهد که تأخیر آن از طریق تنظیمات استنتاج قابل کنترل است و همپوشانی صداها نیز مستقیماً در تنسور خروجی نمایش داده می‌شود.

تیم‌هایی که در حال حاضر از ترکیب ابزارهای تشخیص فعالیت صوتی، خوشه‌بندی و تطبیق کانال استفاده می‌کنند، اکنون می‌توانند به جای همه آن‌ها از یک سیستم تفکیک عصبی واحد بهره ببرند. شرکت‌های مختلفی این مدل را در ابزارهای خود برای پردازش محلی متون ادغام کرده‌اند و انتظار می‌رود استفاده از آن گسترش یابد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر