پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

صدرنشینی شگفت‌انگیز مدل صوتی مایکروسافت؛ نسخه استریمینگ MAI-Transcribe با خطای ۲.۵ درصدی رکورد زد!

انتشار:۱۰ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

مایکروسافت با عرضه مدل MAI-Transcribe-2-Streaming و ثبت نرخ خطای خیره‌کننده ۲.۵ درصدی، در صدر بنچمارک معتبر Artificial Analysis قرار گرفت. این مدل پیشرفته با تأخیر استثنایی ۰.۱۳ ثانیه‌ای تحولی در سرعت ایجنت‌های صوتی و زیرنویس‌های زنده ایجاد می‌کند، هرچند قیمت بالا و نبود توافق‌نامه سطح خدمات (SLA) در فاز پیش‌نمایش از چالش‌های فعلی آن به شمار می‌روند.

صدرنشینی شگفت‌انگیز مدل صوتی مایکروسافت؛ نسخه استریمینگ MAI-Transcribe با خطای ۲.۵ درصدی رکورد زد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مایکروسافت با عرضه مدل جدید MAI-Transcribe-2-Streaming موفق شد ۳۸ رقیب سرسخت از جمله مدل‌های Grok و ElevenLabs را کنار بزند و رتبه نخست بنچمارک مستقل Artificial Analysis را تصاحب کند.
  • این مدل پردازش زنده صدا، نرخ خطای کلمات (WER) را به رکورد فوق‌العاده ۲.۵ درصد و تأخیر پس از پایان گفتار را به ۰.۱۳ ثانیه رسانده که برای ایجنت‌های صوتی و زیرنویس همزمان ایده‌آل است.
  • هزینه نسخه استریمینگ ۹ دلار به ازای هر ۱۰۰۰ دقیقه و برابر با جمینای گوگل تعیین شده، در حالی که نسخه پردازش دسته‌ای (Batch) آن تا پایان سال ۲۰۲۶ با تخفیف ویژه ساعتی ۱۰ سنت ارائه می‌شود.

صدرنشینی تبدیل‌کننده زنده گفتار مایکروسافت در یک بنچمارک مستقل

تیم هوش مصنوعی مایکروسافت (Microsoft AI) از مدل MAI-Transcribe-2-Streaming رونمایی کرد؛ ابزاری برای تبدیل بلادرنگ و زنده گفتار به متن که مکمل نسخه پردازش دسته‌ای (Batch) این شرکت محسوب می‌شود. در جدید‌ترین رده‌بندی پلتفرم مستقل Artificial Analysis، این مدل با ثبت نرخ خطای کلمات (WER) فقط ۲.۵ درصدی و تأخیر ناچیز ۰.۱۳ ثانیه‌ای پس از پایان گفتار، جایگاه نخست را در میان ۳۸ مدل رقیب به خود اختصاص داده است. نرخ خطای پایین نیاز به ویرایش‌های دستی را تا حد زیادی برطرف می‌کند و تأخیر بسیار کم نیز به زیرنویس‌های زنده و ایجنت‌های صوتی اجازه می‌دهد با سرعتی باورنکردنی پاسخ دهند.

این محصول تازه، گامی نو در توسعه خانواده مدل‌های MAI به شمار می‌رود که پیش‌تر مدل MAI-Transcribe-1.5 و نسخه پردازش دسته‌ای را در خود جای داده بود. در پردازش استریمینگ، خروجی متن هم‌زمان با دریافت امواج صوتی تولید می‌شود، در حالی که نسخه دسته‌ای فایل‌های صوتی کامل و ضبط‌شده را پردازش می‌کند. بر اساس گزارش‌های منتشرشده از پیشینه پروژه و ساختار تیم، این مدل‌ها حاصل تلاش یک هسته مرکزی ۱۰ نفره هستند که تیم‌های گسترده‌تر داده و همکاران تجاری نیز از آن‌ها پشتیبانی کرده‌اند.

کم‌ترین نرخ خطا در کنار پاسخی برق‌آسا

پلتفرم تحقیقاتی Artificial Analysis کیفیت مدل‌های تشخیص صدا را با معیار «نرخ خطای کلمات» یا WER و زمان لازم برای ارائه متن‌های اولیه و نهایی می‌سنجد. هر چه نرخ WER کم‌تر باشد، دقت سیستم بالا‌تر است؛ به عنوان نمونه، امتیاز ۲.۵ درصدی یعنی به ازای هر ۱۰۰ کلمه معیار، تقریباً ۲.۵ خطا (شامل تغییر، حذف یا اضافه شدن کلمات) رخ داده است.

مدل
نرخ خطای نهایی (WER)
تأخیر پس از پایان گفتار
MAI-Transcribe-2-Streaming
۲.۵٪
۰.۱۳ ثانیه
Grok Voice Transcribe 2.0
۲.۷٪
۰.۴۹ ثانیه
Muse Voice Transcribe
۳.۱٪
۰.۱۶ ثانیه
Cartesia Ink Preview
۳.۱٪
۰.۱۱ ثانیه
ElevenLabs Scribe v2 Realtime
۳.۶٪
۰.۱۴ ثانیه

از منظر سرعت در ارائه اولین کلمات (First-Partial)، مدل مایکروسافت در کنار نرخ خطای ۲.۵ درصدی توانسته ظرف ۰.۱۲ ثانیه اولین خروجی متن را تولید کند. برای مقایسه، مدل Grok Voice Transcribe 2.0 شرکت xAI خطای ۳.۴ درصدی را در زمان ۰.۴۹ ثانیه به ثبت رسانده است. از طرفی مدل Cartesia Ink-2 هرچند با ۰.۰۷ ثانیه خروجی اولیه سریع‌تری ارائه می‌دهد، اما نرخ خطای آن بالا‌تر و ۴.۰ درصد است. در حال حاضر هیچ مدلی در جدول نتوانسته در هر دو شاخصِ سرعت و دقت به طور هم‌زمان از MAI پیشی بگیرد.

البته نباید فراموش کرد که عملکرد این ابزار‌ها در پروژه‌های عملیاتی ممکن است تحت تأثیر عواملی مثل تنوع زبان، لهجه، نویز پس‌زمینه، صحبت هم‌زمان چند نفر، اصطلاحات تخصصی، الگوریتم‌های تشخیص انتهای کلام و فاصله از سرور تغییر کند. علاوه بر این، پایداری متن‌های اولیه بسیار حیاتی است؛ زیرا اگر سیستم مدام کلمات اولیه را عوض کند، صفحه زیرنویس دچار پرش می‌شود یا ممکن است ایجنت صوتی خیلی زودتر از پایان صحبت فعال شود. بنابراین اگرچه جدول بنچمارک تصویر اولیه فوق‌العاده‌ای ارائه می‌دهد، اما تست نهایی باید با فایل‌های صوتی واقعی انجام گیرد.

نسخه استریمینگ با قیمت پرمیوم عرضه می‌شود

استفاده از مدل MAI-Transcribe-2-Streaming به ازای هر ساعت صوت ۰.۵۴ دلار هزینه دارد که معادل ۹ دلار برای هر ۱۰۰۰ دقیقه است. این رقم دقیقاً با مدل Gemini 3.5 Transcribe Live گوگل برابری می‌کند و از چندین رقیب نزدیک دیگر گران‌تر است.

مدل
قیمت به ازای ۱۰۰۰ دقیقه
MAI-Transcribe-2-Streaming
۹.۰۰ دلار
Gemini 3.5 Transcribe Live
۹.۰۰ دلار
ElevenLabs Scribe v2 Realtime
۶.۵۰ دلار
Deepgram Flux
۶.۵۰ دلار
Cartesia Ink-2
۴.۰۰ دلار
Muse Voice Transcribe
۳.۰۰ دلار

در نقطه مقابل، مایکروسافت نسخه غیرهمزمان MAI-Transcribe-2 را تا پایان سال ۲۰۲۶ با یک نرخ تبلیغاتی و فوق‌العاده ارزان ۰.۱۰ دلار به ازای هر ساعت صوت در دسترس قرار داده است. مدل نسل قبلی یعنی MAI-Transcribe-1.5 نیز ۰.۳۶ دلار در ساعت قیمت دارد. با این تعرفه‌ها، پردازش ۱۰۰۰ ساعت فایل صوتی با نسخه تخفیف‌خورده دسته‌ای فقط ۱۰۰ دلار هزینه برمی‌دارد، در حالی که انجام همین حجم کار با نسخه زنده و استریمینگ ۵۴۰ دلار آب می‌خورد (بدون احتساب هزینه‌های زیرساختی جانبی).

نحوه استقرار و وضعیت دسترسی به API

نوع بار کاری
مدل
نحوه دسترسی
وضعیت
صوت از پیش ضبط‌شده
MAI-Transcribe-2
پلتفرم‌های Microsoft Foundry، محیط MAI Playground، پلتفرم OpenRouter و سرویس Azure Speech
پیش‌نمایش عمومی در Azure Speech (مناطق شرق آمریکا، غرب آمریکا، جنوب شرق آسیا و شمال اروپا)
صوت زنده و بلادرنگ
MAI-Transcribe-2-Streaming
رابط برنامه‌نویسی Voice Live API
پیش‌نمایش عمومی بدون تضمین سطح کیفیت خدمات (SLA)

پردازش فایل‌های ضبط‌شده از طریق رابط Fast Transcription API انجام می‌شود، در حالی که صدای زنده به Voice Live API مجزا متکی است. مایکروسافت صراحتاً توصیه کرده که کاربران فعلاً از نسخه پیش‌نمایش Voice Live در پروژه‌های نهایی و حساس پروداکشن استفاده نکنند، زیرا هنوز فاقد توافق‌نامه رسمی سطح خدمات (SLA) است. به این ترتیب، سامانه‌هایی که مستقیماً با مشتری نهایی در ارتباط هستند، باید یا از یک ارائه‌دهنده پشتیبان (Fallback) کمک بگیرند یا ریسک ناپایداری‌های احتمالی دوره پیش‌نمایش را بپذیرند.

مایکروسافت قابلیت‌های کلیدی زیر را برای خانواده MAI Transcribe برمی‌شمارد (اگرچه دسترسی به آن‌ها ممکن است بسته به سرویس و سرور انتخابی متفاوت باشد):

  • یک مدل جامع چندزبانه با پوشش ۶۰ زبان دنیا
  • تشخیص و تفکیک هوشمند گویندگان (Speaker Diarization)
  • برچسب‌گذاری زمانی دقیق در سطح تک‌تک کلمات (Timestamps)
  • هدایت کلیدواژه‌ای برای درک بهتر نام‌های خاص و اصطلاحات تخصصی (Keyword Biasing)
  • امکان دریافت خروجی به دو شکل: متن کاملاً کلمه‌به‌کلمه یا متن پالایش‌شده و تمیز

تأخیر زیر ۱۵۰ میلی‌ثانیه؛ نجات‌بخش چه سناریوهایی است؟

زمان پاسخ‌دهی شگفت‌انگیزِ زیر ۱۵۰ میلی‌ثانیه دقیقاً مناسب کاربردهایی است که متن پیاده‌شده باید فوراً به دست کاربر یا نرم‌افزارهای پردازش بعدی برسد:

  • زیرنویس همزمان: در جلسات کاری، کلاس‌های درس، پخش برنامه‌های زنده تلویزیونی و ابزار‌های دسترس‌پذیری، متن بدون معطلی و در لحظه نقش می‌بندد.
  • ایجنت‌های صوتی: درست در همان لحظه‌ای که صحبت کاربر تمام می‌شود، متن نهایی به مدل زبانی می‌رسد تا پاسخ صوتی بدون وقفه آماده شود.
  • مراکز تماس و پشتیبانی: ارزیابی لحظه‌ای مکالمات، بررسی رعایت دستورالعمل‌های سازمانی و ارائه پیشنهادات هم‌زمان به اپراتور در حین تماس تلفنی.
  • تایپ صوتی (دیکته): متن بلافاصله و هم‌گام با صحبت کردن فرد روی صفحه تایپ می‌شود.

در سوی دیگر، نسخه دسته‌ای (Batch) انتخابی ایده‌آل برای بایگانی جلسات، فایل‌های ضبط‌شده مکالمات، پادکست‌ها، آرشیوهای صوتی و سایر سناریوهایی است که به تعامل آنی نیازی ندارند. نرخ تخفیفی این مدل باعث شده پیاده‌سازی حجم انبوهی از فایل‌های صوتی گذشته با کم‌ترین هزینه ممکن انجام شود، به شرط آن‌که نیازی به تحویل آنی نداشته باشید.

چک‌لیست تست و ارزیابی مسیر پردازش صدا

  1. تنوع صوتی: مدل را با زبان‌ها، لهجه‌ها، میکروفون‌های گوناگون، شدت نویز محیط، صحبت هم‌زمان افراد و کلمات تخصصی حوزه کاری خود بیازمایید.
  2. تأخیر سرتاسری (End-to-End): به تأخیر اعلام‌شده خودِ مدل بسنده نکنید؛ بلکه زمان مورد نیاز برای ضبط صدا، ارسال در شبکه، تشخیص انتهای کلام، تبدیل به متن و پردازش در لایه‌های بعدی را نیز لحاظ کنید.
  3. پایداری متن‌های اولیه: بررسی کنید که خروجی موقت حین استریم چقدر ویرایش می‌شود و آیا این بازبینی‌های مکرر باعث اختلال در زیرنویس یا تحریک زودهنگام ایجنت صوتی می‌گردد یا خیر.
  4. رفتار و محدودیت‌های API: مواردی همچون سقف اتصالات هم‌زمان، مدت‌زمان هر نشست (Session)، دسترسی منطقه‌ای، سازوکار تلاش مجدد (Retry) و سقف نرخ درخواست‌ها را شفاف کنید.
  5. پشتیبانی از امکانات جانبی: وجود ویژگی‌هایی مانند تفکیک گویندگان، ثبت زمان‌بندی کلمات، تنظیم کلیدواژه‌ها و استانداردسازی خروجی را در سرویس مدنظر ارزیابی نمایید.
  6. هزینه‌ها و چالش‌های عملیاتی: به مسائلی نظیر قیمت تمام‌شده، شیوه ذخیره‌سازی داده‌ها، الزامات حریم خصوصی، سیستم جایگزین در صورت قطعی (Fallback) و البته نبود توافق‌نامه تضمین سطح خدمات (SLA) در نسخه فعلی توجه ویژه داشته باشید.

مایکروسافت خلأ پردازش زنده صدا را پر می‌کند

مدل MAI-Transcribe-2-Streaming یک ابزار قدرتمند با دقت بالا و تأخیر بسیار ناچیز برای پردازش زنده صداست که خلأ موجود در سبد محصولات مایکروسافت را در کنار نسخه ارزان‌قیمت دسته‌ای پر می‌کند. با وجود این، قیمت ۹ دلاری به ازای هر ۱۰۰۰ دقیقه و ارائه آزمایشی در قالب نسخه پیش‌نمایش، بزرگ‌ترین چالش‌های پذیرش آن هستند. گسترش استفاده تجاری از این فناوری در نهایت به دقت آن در کاربردهای خاص، تأخیر واقعی در بستر شبکه، گستره پوشش منطقه‌ای، پایداری متن‌های لحظه‌ای و در رأس همه این‌ها، ارائه رسمی توافق‌نامه سطح خدمات (SLA) از سوی مایکروسافت وابسته خواهد بود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

معرفی پروژه متن‌باز OpenDots توسط CopilotKit؛ ساخت همکاران هوش مصنوعی همیشه‌بیدار با دسترسی به وب، اسلک و صدا
آخرین اخبار

معرفی پروژه متن‌باز OpenDots توسط CopilotKit؛ ساخت همکاران هوش مصنوعی همیشه‌بیدار با دسترسی به وب، اسلک و صدا

تیم CopilotKit با انتشار قالب متن‌باز OpenDots، ساخت همکاران هوش مصنوعی همیشه‌بیدار را برای برنامه‌نویسان راحت‌تر از همیشه کرده است. این ابزار به ایجنت‌ها اجازه می‌دهد به وب، اسلک و حتی مکالمات صوتی دسترسی داشته باشند و در محیط‌هایی کاملاً ایزوله کار‌های تیمی را جلو ببرند.

۲ دقیقه مطالعه
۰
۱۰ مهر
۹ دستور «اسلش» شگفت‌انگیز در چت‌جی‌پی‌تی برای گرفتن بهترین پاسخ‌ها
آخرین اخبار

۹ دستور «اسلش» شگفت‌انگیز در چت‌جی‌پی‌تی برای گرفتن بهترین پاسخ‌ها

اگر از پرحرفی یا پاسخ‌های کلیشه‌ای چت‌جی‌پی‌تی کلافه شده‌اید، با اضافه کردن چند دستور ساده با علامت اسلش (/) می‌توانید خروجی هوش مصنوعی را متحول کنید. در این راهنما با ۹ دستور کاربردی آشنا می‌شوید که کیفیت پاسخ‌های مدل‌های زبانی را به اوج می‌رسانند.

۷ دقیقه مطالعه
۰
۱۰ مهر
شاهکار آزمایشگاه کیوتای؛ بازآموزی مدل صوتی PocketTTS با روش جدید و نرخ خطای فوق‌العاده ۰.۹ درصد!
آخرین اخبار

شاهکار آزمایشگاه کیوتای؛ بازآموزی مدل صوتی PocketTTS با روش جدید و نرخ خطای فوق‌العاده ۰.۹ درصد!

آزمایشگاه فرانسوی کیوتای با بازآموزی مدل صوتی کم‌حجم PocketTTS از طریق روش خلاقانه Drifting، موفق شد پیچیدگی‌های محاسباتی سنگین را کنار بگذارد و به نرخ خطای خارق‌العاده ۰.۹۰ درصد برسد. این مدل ۱۰۰ میلیون پارامتری به طور کامل روی CPU اجرا می‌شود، از شبیه‌سازی صدا و استریم زنده پشتیبانی می‌کند و با حفظ کیفیت چشمگیر، فرایند آموزش مدل‌های گفتاری را بسیار ساده‌تر و بهینه‌تر کرده است.

۴ دقیقه مطالعه
۰
۱۰ مهر