مدل Nemotron 3 شرکت NVIDIA با ثبت خطای ۱۴.۷۲ درصدی ۱۲ رقیب خود را شکست داد
شرکت NVIDIA از مدل متنباز ۱۰۰ میلیون پارامتری Nemotron 3 Diarization رونمایی کرد که توانایی تشخیص و تفکیک صدای تا ۸ گوینده مختلف را در فایلهای صوتی دارد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل جدید Nemotron 3 با ۱۰۰ میلیون پارامتر، توانایی تفکیک همزمان صدای ۸ گوینده را در جریانهای صوتی زنده و آفلاین دارد.
- این مدل در بنچمارکهای تخصصی با ثبت خطای ۱۴.۷۲ درصد، برتری قابلتوجهی نسبت به رقبا به دست آورده است.
- حذف نیاز به تطبیق دستی کانالها و امکان تنظیم میزان تأخیر در حین استنتاج، از مهمترین ویژگیهای این مدل برای توسعهدهندگان است.
مدل ۱۰۰ میلیون پارامتری Nemotron 3 شرکت NVIDIA برای تفکیک صدای زنده
شرکت NVIDIA مدل Nemotron 3 Diarization را منتشر کرده است؛ یک مدل ۱۰۰ میلیون پارامتری که میتواند زمان صحبت کردن هر شخص را در فایلهای صوتی ضبطشده یا زنده تشخیص دهد. این مدل با وزنهای باز (open-weight) از استنتاج آفلاین و زنده (streaming)، همپوشانی گفتار و پشتیبانی از حداکثر ۸ گوینده پشتیبانی میکند. همچنین دمو این مدل در پلتفرم Hugging Face در دسترس قرار گرفته است.
نتایج اولیه بنچمارک Diarization-Bench نشان میدهد که این مدل در میان ۱۲ سیستم و ۱۷ پیکربندی مختلف روی ۱۳۹ مکالمه انگلیسی (در مجموع حدود ۲۲ ساعت) در رتبه نخست قرار گرفته است. مدل Nemotron نرخ خطای تفکیک (DER) معادل ۱۴.۷۲ درصد را ثبت کرد که در مقایسه با نرخ ۱۹.۳ درصدی بهترین پیکربندی بعدی، نشاندهنده کاهش نسبی ۲۳.۷ درصدی است. این بنچمارک همپوشانی گفتار را نیز در نظر گرفته و بدون هیچ حاشیه خطایی (boundary collar) ارزیابی شده است، به این معنی که هیچگونه تلورانسی برای زمان جابجایی بین گویندگان در نظر گرفته نشده است.
برچسبگذاری گویندگان در بازههای ۸۰ میلیثانیهای
سیستم تفکیک گوینده به هر فردی که صحبت میکند یک برچسب و توالیای از بازههای زمانی اختصاص میدهد. این بازهها میتوانند با برچسبهای زمانی کلمات از یک مدل تشخیص خودکار گفتار ترکیب شوند تا متنی دقیق با ذکر نام گوینده تولید کنند. معیار DER سهمی از زمان صحبت گویندگان را که دچار تشخیص ازدسترفته، تشخیص اشتباه یا انتساب به گوینده نادرست شده است اندازهگیری میکند، بنابراین مقادیر کمتر نشاندهنده عملکرد بهتر است.
یک سیستم تفکیک صدای زنده، قطعات کوچک صوتی را با دسترسی محدود به زمینه اطراف آن دریافت میکند. این سیستم باید انتساب گویندگان را بین قطعات مختلف حفظ کند، حتی پس از وقفهها و پریدن در حرف یکدیگر. اگر این تطبیق دچار مشکل شود، ممکن است یک فرد در یک قطعه به عنوان speaker_1 و در قطعه بعدی به عنوان speaker_2 شناخته شود که این امر باعث خراب شدن متن پیادهسازیشده و خلاصههای نهایی میشود.
ترتیب ورود از تغییر برچسبها جلوگیری میکند
مدل Nemotron از رویکرد Sortformer استفاده میکند که گویندگان را بر اساس اولین باری که صحبت میکنند مرتب میکند. اولین صدای تشخیصدادهشده کانال یک را اشغال میکند، صدای جدید بعدی در کانال دو قرار میگیرد و صداهای بعدی نیز از همین قانون پیروی میکنند. این مرتبسازی پایدار، نیاز به تطبیق مجدد و تصادفی کانالهای خروجی برای هر قطعه را از بین میبرد.
این مدل فایلهای صوتی مونو ۱۶ کیلوهرتز را دریافت کرده و آنها را در بازههای ۱۰ میلیثانیهای به ویژگیهای Mel-spectrogram (نمایشی زمان-فرکانس از سیگنال) تبدیل میکند. سپس هشت فریم ویژگی را در یک فریم رمزگذار ۸۰ میلیثانیهای ترکیب کرده و آنها را با استفاده از یک Transformer دارای ۳۱ لایه و تعبیههای موقعیتی چرخشی برای حفظ ترتیب فریمها پردازش میکند.
خروجی پیشفرض یک تنسور ممیز شناور [T, 8] است که شامل احتمال فعالیت برای هر کانال گوینده در هر مرحله زمانی است. کانالهای مستقل اجازه میدهند چندین گوینده به طور همزمان در یک فریم فعال باشند. استنتاج زنده، پیوستگی را از طریق سه ساختار حافظه حفظ میکند:
- حافظه پنهان گویندگان بر اساس ترتیب ورود: اطلاعات مربوط به گویندگان را از قطعات قبلی نگه میدارد و آنها را به کانالهای ترتیببندیشده متصل میکند.
- صف زمینه FIFO: فریمهای اخیری که بلافاصله قبل از قطعه فعلی قرار دارند را فراهم میکند.
- بافر زمینه راست: مقدار کمی از صوت آینده را برای رفع ابهام تغییر گوینده اضافه میکند که باعث افزایش تأخیر بافر ورودی در ازای دسترسی به زمینه بیشتر میشود.
تنظیم تأخیر در زمان استنتاج
این مدل چهار پروفایل بافر پیشنهادی را در اختیار قرار میدهد که به برنامهها اجازه میدهد بدون نیاز به آموزش مجدد مدل، تعادل میان تأخیر و دقت را انتخاب کنند.
پروفایل | تأخیر بافر ورودی | طول قطعه | زمینه راست |
|---|---|---|---|
زمینه بالا | ۳۰.۴ ثانیه | ۳۴۰ فریم، ۲۷.۲ ثانیه | ۴۰ فریم، ۳.۲ ثانیه |
تأخیر پایین | ۱.۰۴ ثانیه | ۹ فریم، ۰.۷۲ ثانیه | ۴ فریم، ۰.۳۲ ثانیه |
تأخیر بسیار پایین | ۰.۶۴ ثانیه | ۶ فریم، ۰.۴۸ ثانیه | ۲ فریم، ۰.۱۶ ثانیه |
تأخیر فوقالعاده پایین | ۰.۳۲ ثانیه | ۳ فریم، ۰.۲۴ ثانیه | ۱ فریم، ۰.۰۸ ثانیه |
تأخیر بافر ورودی برابر با (chunk_len + right_context) × 80 ms است. ارقام منتشرشده شامل زمان اجرای مدل، انتقال شبکه، ضبط صدا و تشخیص گفتار نهایی نمیشوند.
دستاوردها فراتر از بنچمارک اصلی
بر اساس گزارشهای منتشرشده، مدل Nemotron با نسخه پایه چهار-گوینده قبلی خود مقایسه شده است. در تنظیمات ۱.۰۴ ثانیهای، مدل جدید نرخ خطا (DER) را در هر هشت شرایط ارزیابی گزارششده کاهش میدهد. کاهشهای نسبی از ۹.۰ درصد در CALLHOME-Part2 تا ۶۵.۲ درصد در NOTSOFAR1 MHM متغیر است. میانگین گزارششده ۴۱.۰ درصدی به هر مجموعه داده وزن یکسانی میدهد.
آزمون توان عملیاتی نشان میدهد که پردازش در زمان واقعی با اندازه دسته ۳۲ و استفاده از torch.compile() به ۱۵٬۱۱۳ برابر رسیده است، در حالی که این رقم برای مدل قبلی ۲٬۶۱۹ برابر بود. این میزان حدود ۵.۸ برابر توان عملیاتی نسخه پایه روی یک کارت گرافیک RTX PRO 5000 است. در همین مقایسه، خطای مجموعه داده DIHARD III از ۱۹.۰۹ درصد به ۱۲.۷۳ درصد کاهش یافته است.
پشتیبانی از هشت گوینده، بیشترین پیشرفت را در زیرمجموعههایی با تعداد گویندگان زیاد نشان میدهد. این شرایط، محدودیت چهار-گوینده ثابت در مدلهای قبلی را به خوبی مشخص میکند.
مواردی که دقت مدل کاهش مییابد
- کانالهای ناشناس: برچسبهایی مانند
speaker_2تنها صداها را در یک فایل پیگیری میکنند. اختصاص دادن نام واقعی نیازمند دسترسی به متادیتا یا یک سیستم مجزا برای تأیید هویت گوینده است. - محدودیت هشت-گوینده: فایلهای صوتی با بیش از هشت شرکتکننده میتوانند منجر به از دست رفتن برخی مکالمات یا انتساب اشتباه کانالها شوند.
- حساسیت آکوستیک: عواملی مانند نویز، بازتاب شدید صدا، میکروفونهای دوردست، تغییرات محیطی و مکالمات طولانی میتوانند باعث افزایش تشخیصهای ازدسترفته، هشدارهای اشتباه، خطاهای مرزی و اشتباه گرفتن گویندگان شوند.
- محدوده زبان انگلیسی در بنچمارکها: نتایج اصلی بنچمارکها مربوط به مکالمات انگلیسی است و تضمینی برای دقت مشابه در سایر زبانها ارائه نمیدهد.
- افت در مکالمات دو نفره: در زیرمجموعه دوگوینده CALLHOME، مدل Nemotron خطای ۵.۹۸ درصدی ثبت کرده است، در حالی که این رقم برای مدل پایه قبلی معادل ۵.۶۸ درصد بود.
اجرای پروفایل زمینه بالا در NeMo
from nemo.collections.asr.models import SortformerEncLabelModel
diar_model = SortformerEncLabelModel.from_pretrained(
\"nvidia/Nemotron-3-Diarization\"
)
diar_model.eval()
diar_model.sortformer_modules.spkcache_len = 264
diar_model.sortformer_modules.fifo_len = 40
diar_model.sortformer_modules.chunk_len = 340
diar_model.sortformer_modules.chunk_right_context = 40
diar_model.sortformer_modules.spkcache_update_period = 300
diar_model._check_streaming_parameters()
predicted_segments = diar_model.diarize(
audio=[\"/path/to/conversation.wav\"],
batch_size=1,
)مقادیر قطعه و زمینه راست در این مثال، بافر ورودی ۳۰.۴ ثانیهای تولید میکنند. این روش قطعات زمانبندیشده را در قالب رشتههای start end speaker_id بازمیگرداند.
فریمورک NeMo میتواند یک مسیر صوتی، لیستی از مسیرها، آرایههای NumPy یا یک فایل JSON را به عنوان ورودی بپذیرد. فرمتهای پشتیبانیشده شامل فایلهای تککاناله ۱۶ کیلوهرتز نظیر .wav، .flac، .opus و .mp3 هستند.
یک مدل تشخیص خودکار گفتار با برچسب زمانی کلمات میتواند متن مکالمه را فراهم کند. سپس یک برنامه میتواند هر کلمه یا قطعه را با بازههای زمانی گویندگان فعال مدل Nemotron همگامسازی کند تا یک متن پیادهسازیشده و تفکیکشده ساخته شود.
تنظیمات استقرار منتشرشده برای سیستمعامل لینوکس و کارتهای گرافیک شرکت NVIDIA بهینهسازی شدهاند. وزنهای این مدل تحت مجوز باز منتشر شده است.
زیرساخت پردازش صدای سبکتر
دستیارهای جلسات، سیستمهای تحلیل تماس، ابزارهای پادکست و ایجنتهای صوتی چندنفره به انتساب دقیق صداها وابستهاند، زیرا خطاهای تشخیص گوینده به خلاصهها و نمایههای جستجو منتقل میشوند. مدل Nemotron به این برنامهها یک ساختار واحد برای صداهای زنده و ضبطشده ارائه میدهد که تأخیر آن از طریق تنظیمات استنتاج قابل کنترل است و همپوشانی صداها نیز مستقیماً در تنسور خروجی نمایش داده میشود.
تیمهایی که در حال حاضر از ترکیب ابزارهای تشخیص فعالیت صوتی، خوشهبندی و تطبیق کانال استفاده میکنند، اکنون میتوانند به جای همه آنها از یک سیستم تفکیک عصبی واحد بهره ببرند. شرکتهای مختلفی این مدل را در ابزارهای خود برای پردازش محلی متون ادغام کردهاند و انتظار میرود استفاده از آن گسترش یابد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.