صدرنشینی شگفتانگیز مدل صوتی مایکروسافت؛ نسخه استریمینگ MAI-Transcribe با خطای ۲.۵ درصدی رکورد زد!
مایکروسافت با عرضه مدل MAI-Transcribe-2-Streaming و ثبت نرخ خطای خیرهکننده ۲.۵ درصدی، در صدر بنچمارک معتبر Artificial Analysis قرار گرفت. این مدل پیشرفته با تأخیر استثنایی ۰.۱۳ ثانیهای تحولی در سرعت ایجنتهای صوتی و زیرنویسهای زنده ایجاد میکند، هرچند قیمت بالا و نبود توافقنامه سطح خدمات (SLA) در فاز پیشنمایش از چالشهای فعلی آن به شمار میروند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مایکروسافت با عرضه مدل جدید MAI-Transcribe-2-Streaming موفق شد ۳۸ رقیب سرسخت از جمله مدلهای Grok و ElevenLabs را کنار بزند و رتبه نخست بنچمارک مستقل Artificial Analysis را تصاحب کند.
- این مدل پردازش زنده صدا، نرخ خطای کلمات (WER) را به رکورد فوقالعاده ۲.۵ درصد و تأخیر پس از پایان گفتار را به ۰.۱۳ ثانیه رسانده که برای ایجنتهای صوتی و زیرنویس همزمان ایدهآل است.
- هزینه نسخه استریمینگ ۹ دلار به ازای هر ۱۰۰۰ دقیقه و برابر با جمینای گوگل تعیین شده، در حالی که نسخه پردازش دستهای (Batch) آن تا پایان سال ۲۰۲۶ با تخفیف ویژه ساعتی ۱۰ سنت ارائه میشود.
صدرنشینی تبدیلکننده زنده گفتار مایکروسافت در یک بنچمارک مستقل
تیم هوش مصنوعی مایکروسافت (Microsoft AI) از مدل MAI-Transcribe-2-Streaming رونمایی کرد؛ ابزاری برای تبدیل بلادرنگ و زنده گفتار به متن که مکمل نسخه پردازش دستهای (Batch) این شرکت محسوب میشود. در جدیدترین ردهبندی پلتفرم مستقل Artificial Analysis، این مدل با ثبت نرخ خطای کلمات (WER) فقط ۲.۵ درصدی و تأخیر ناچیز ۰.۱۳ ثانیهای پس از پایان گفتار، جایگاه نخست را در میان ۳۸ مدل رقیب به خود اختصاص داده است. نرخ خطای پایین نیاز به ویرایشهای دستی را تا حد زیادی برطرف میکند و تأخیر بسیار کم نیز به زیرنویسهای زنده و ایجنتهای صوتی اجازه میدهد با سرعتی باورنکردنی پاسخ دهند.
این محصول تازه، گامی نو در توسعه خانواده مدلهای MAI به شمار میرود که پیشتر مدل MAI-Transcribe-1.5 و نسخه پردازش دستهای را در خود جای داده بود. در پردازش استریمینگ، خروجی متن همزمان با دریافت امواج صوتی تولید میشود، در حالی که نسخه دستهای فایلهای صوتی کامل و ضبطشده را پردازش میکند. بر اساس گزارشهای منتشرشده از پیشینه پروژه و ساختار تیم، این مدلها حاصل تلاش یک هسته مرکزی ۱۰ نفره هستند که تیمهای گستردهتر داده و همکاران تجاری نیز از آنها پشتیبانی کردهاند.
کمترین نرخ خطا در کنار پاسخی برقآسا
پلتفرم تحقیقاتی Artificial Analysis کیفیت مدلهای تشخیص صدا را با معیار «نرخ خطای کلمات» یا WER و زمان لازم برای ارائه متنهای اولیه و نهایی میسنجد. هر چه نرخ WER کمتر باشد، دقت سیستم بالاتر است؛ به عنوان نمونه، امتیاز ۲.۵ درصدی یعنی به ازای هر ۱۰۰ کلمه معیار، تقریباً ۲.۵ خطا (شامل تغییر، حذف یا اضافه شدن کلمات) رخ داده است.
مدل | نرخ خطای نهایی (WER) | تأخیر پس از پایان گفتار |
|---|---|---|
MAI-Transcribe-2-Streaming | ۲.۵٪ | ۰.۱۳ ثانیه |
Grok Voice Transcribe 2.0 | ۲.۷٪ | ۰.۴۹ ثانیه |
Muse Voice Transcribe | ۳.۱٪ | ۰.۱۶ ثانیه |
Cartesia Ink Preview | ۳.۱٪ | ۰.۱۱ ثانیه |
ElevenLabs Scribe v2 Realtime | ۳.۶٪ | ۰.۱۴ ثانیه |
از منظر سرعت در ارائه اولین کلمات (First-Partial)، مدل مایکروسافت در کنار نرخ خطای ۲.۵ درصدی توانسته ظرف ۰.۱۲ ثانیه اولین خروجی متن را تولید کند. برای مقایسه، مدل Grok Voice Transcribe 2.0 شرکت xAI خطای ۳.۴ درصدی را در زمان ۰.۴۹ ثانیه به ثبت رسانده است. از طرفی مدل Cartesia Ink-2 هرچند با ۰.۰۷ ثانیه خروجی اولیه سریعتری ارائه میدهد، اما نرخ خطای آن بالاتر و ۴.۰ درصد است. در حال حاضر هیچ مدلی در جدول نتوانسته در هر دو شاخصِ سرعت و دقت به طور همزمان از MAI پیشی بگیرد.
البته نباید فراموش کرد که عملکرد این ابزارها در پروژههای عملیاتی ممکن است تحت تأثیر عواملی مثل تنوع زبان، لهجه، نویز پسزمینه، صحبت همزمان چند نفر، اصطلاحات تخصصی، الگوریتمهای تشخیص انتهای کلام و فاصله از سرور تغییر کند. علاوه بر این، پایداری متنهای اولیه بسیار حیاتی است؛ زیرا اگر سیستم مدام کلمات اولیه را عوض کند، صفحه زیرنویس دچار پرش میشود یا ممکن است ایجنت صوتی خیلی زودتر از پایان صحبت فعال شود. بنابراین اگرچه جدول بنچمارک تصویر اولیه فوقالعادهای ارائه میدهد، اما تست نهایی باید با فایلهای صوتی واقعی انجام گیرد.
نسخه استریمینگ با قیمت پرمیوم عرضه میشود
استفاده از مدل MAI-Transcribe-2-Streaming به ازای هر ساعت صوت ۰.۵۴ دلار هزینه دارد که معادل ۹ دلار برای هر ۱۰۰۰ دقیقه است. این رقم دقیقاً با مدل Gemini 3.5 Transcribe Live گوگل برابری میکند و از چندین رقیب نزدیک دیگر گرانتر است.
مدل | قیمت به ازای ۱۰۰۰ دقیقه |
|---|---|
MAI-Transcribe-2-Streaming | ۹.۰۰ دلار |
Gemini 3.5 Transcribe Live | ۹.۰۰ دلار |
ElevenLabs Scribe v2 Realtime | ۶.۵۰ دلار |
Deepgram Flux | ۶.۵۰ دلار |
Cartesia Ink-2 | ۴.۰۰ دلار |
Muse Voice Transcribe | ۳.۰۰ دلار |
در نقطه مقابل، مایکروسافت نسخه غیرهمزمان MAI-Transcribe-2 را تا پایان سال ۲۰۲۶ با یک نرخ تبلیغاتی و فوقالعاده ارزان ۰.۱۰ دلار به ازای هر ساعت صوت در دسترس قرار داده است. مدل نسل قبلی یعنی MAI-Transcribe-1.5 نیز ۰.۳۶ دلار در ساعت قیمت دارد. با این تعرفهها، پردازش ۱۰۰۰ ساعت فایل صوتی با نسخه تخفیفخورده دستهای فقط ۱۰۰ دلار هزینه برمیدارد، در حالی که انجام همین حجم کار با نسخه زنده و استریمینگ ۵۴۰ دلار آب میخورد (بدون احتساب هزینههای زیرساختی جانبی).
نحوه استقرار و وضعیت دسترسی به API
نوع بار کاری | مدل | نحوه دسترسی | وضعیت |
|---|---|---|---|
صوت از پیش ضبطشده | MAI-Transcribe-2 | پلتفرمهای Microsoft Foundry، محیط MAI Playground، پلتفرم OpenRouter و سرویس Azure Speech | پیشنمایش عمومی در Azure Speech (مناطق شرق آمریکا، غرب آمریکا، جنوب شرق آسیا و شمال اروپا) |
صوت زنده و بلادرنگ | MAI-Transcribe-2-Streaming | رابط برنامهنویسی Voice Live API | پیشنمایش عمومی بدون تضمین سطح کیفیت خدمات (SLA) |
پردازش فایلهای ضبطشده از طریق رابط Fast Transcription API انجام میشود، در حالی که صدای زنده به Voice Live API مجزا متکی است. مایکروسافت صراحتاً توصیه کرده که کاربران فعلاً از نسخه پیشنمایش Voice Live در پروژههای نهایی و حساس پروداکشن استفاده نکنند، زیرا هنوز فاقد توافقنامه رسمی سطح خدمات (SLA) است. به این ترتیب، سامانههایی که مستقیماً با مشتری نهایی در ارتباط هستند، باید یا از یک ارائهدهنده پشتیبان (Fallback) کمک بگیرند یا ریسک ناپایداریهای احتمالی دوره پیشنمایش را بپذیرند.
مایکروسافت قابلیتهای کلیدی زیر را برای خانواده MAI Transcribe برمیشمارد (اگرچه دسترسی به آنها ممکن است بسته به سرویس و سرور انتخابی متفاوت باشد):
- یک مدل جامع چندزبانه با پوشش ۶۰ زبان دنیا
- تشخیص و تفکیک هوشمند گویندگان (Speaker Diarization)
- برچسبگذاری زمانی دقیق در سطح تکتک کلمات (Timestamps)
- هدایت کلیدواژهای برای درک بهتر نامهای خاص و اصطلاحات تخصصی (Keyword Biasing)
- امکان دریافت خروجی به دو شکل: متن کاملاً کلمهبهکلمه یا متن پالایششده و تمیز
تأخیر زیر ۱۵۰ میلیثانیه؛ نجاتبخش چه سناریوهایی است؟
زمان پاسخدهی شگفتانگیزِ زیر ۱۵۰ میلیثانیه دقیقاً مناسب کاربردهایی است که متن پیادهشده باید فوراً به دست کاربر یا نرمافزارهای پردازش بعدی برسد:
- زیرنویس همزمان: در جلسات کاری، کلاسهای درس، پخش برنامههای زنده تلویزیونی و ابزارهای دسترسپذیری، متن بدون معطلی و در لحظه نقش میبندد.
- ایجنتهای صوتی: درست در همان لحظهای که صحبت کاربر تمام میشود، متن نهایی به مدل زبانی میرسد تا پاسخ صوتی بدون وقفه آماده شود.
- مراکز تماس و پشتیبانی: ارزیابی لحظهای مکالمات، بررسی رعایت دستورالعملهای سازمانی و ارائه پیشنهادات همزمان به اپراتور در حین تماس تلفنی.
- تایپ صوتی (دیکته): متن بلافاصله و همگام با صحبت کردن فرد روی صفحه تایپ میشود.
در سوی دیگر، نسخه دستهای (Batch) انتخابی ایدهآل برای بایگانی جلسات، فایلهای ضبطشده مکالمات، پادکستها، آرشیوهای صوتی و سایر سناریوهایی است که به تعامل آنی نیازی ندارند. نرخ تخفیفی این مدل باعث شده پیادهسازی حجم انبوهی از فایلهای صوتی گذشته با کمترین هزینه ممکن انجام شود، به شرط آنکه نیازی به تحویل آنی نداشته باشید.
چکلیست تست و ارزیابی مسیر پردازش صدا
- تنوع صوتی: مدل را با زبانها، لهجهها، میکروفونهای گوناگون، شدت نویز محیط، صحبت همزمان افراد و کلمات تخصصی حوزه کاری خود بیازمایید.
- تأخیر سرتاسری (End-to-End): به تأخیر اعلامشده خودِ مدل بسنده نکنید؛ بلکه زمان مورد نیاز برای ضبط صدا، ارسال در شبکه، تشخیص انتهای کلام، تبدیل به متن و پردازش در لایههای بعدی را نیز لحاظ کنید.
- پایداری متنهای اولیه: بررسی کنید که خروجی موقت حین استریم چقدر ویرایش میشود و آیا این بازبینیهای مکرر باعث اختلال در زیرنویس یا تحریک زودهنگام ایجنت صوتی میگردد یا خیر.
- رفتار و محدودیتهای API: مواردی همچون سقف اتصالات همزمان، مدتزمان هر نشست (Session)، دسترسی منطقهای، سازوکار تلاش مجدد (Retry) و سقف نرخ درخواستها را شفاف کنید.
- پشتیبانی از امکانات جانبی: وجود ویژگیهایی مانند تفکیک گویندگان، ثبت زمانبندی کلمات، تنظیم کلیدواژهها و استانداردسازی خروجی را در سرویس مدنظر ارزیابی نمایید.
- هزینهها و چالشهای عملیاتی: به مسائلی نظیر قیمت تمامشده، شیوه ذخیرهسازی دادهها، الزامات حریم خصوصی، سیستم جایگزین در صورت قطعی (Fallback) و البته نبود توافقنامه تضمین سطح خدمات (SLA) در نسخه فعلی توجه ویژه داشته باشید.
مایکروسافت خلأ پردازش زنده صدا را پر میکند
مدل MAI-Transcribe-2-Streaming یک ابزار قدرتمند با دقت بالا و تأخیر بسیار ناچیز برای پردازش زنده صداست که خلأ موجود در سبد محصولات مایکروسافت را در کنار نسخه ارزانقیمت دستهای پر میکند. با وجود این، قیمت ۹ دلاری به ازای هر ۱۰۰۰ دقیقه و ارائه آزمایشی در قالب نسخه پیشنمایش، بزرگترین چالشهای پذیرش آن هستند. گسترش استفاده تجاری از این فناوری در نهایت به دقت آن در کاربردهای خاص، تأخیر واقعی در بستر شبکه، گستره پوشش منطقهای، پایداری متنهای لحظهای و در رأس همه اینها، ارائه رسمی توافقنامه سطح خدمات (SLA) از سوی مایکروسافت وابسته خواهد بود.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

معرفی پروژه متنباز OpenDots توسط CopilotKit؛ ساخت همکاران هوش مصنوعی همیشهبیدار با دسترسی به وب، اسلک و صدا
تیم CopilotKit با انتشار قالب متنباز OpenDots، ساخت همکاران هوش مصنوعی همیشهبیدار را برای برنامهنویسان راحتتر از همیشه کرده است. این ابزار به ایجنتها اجازه میدهد به وب، اسلک و حتی مکالمات صوتی دسترسی داشته باشند و در محیطهایی کاملاً ایزوله کارهای تیمی را جلو ببرند.

۹ دستور «اسلش» شگفتانگیز در چتجیپیتی برای گرفتن بهترین پاسخها
اگر از پرحرفی یا پاسخهای کلیشهای چتجیپیتی کلافه شدهاید، با اضافه کردن چند دستور ساده با علامت اسلش (/) میتوانید خروجی هوش مصنوعی را متحول کنید. در این راهنما با ۹ دستور کاربردی آشنا میشوید که کیفیت پاسخهای مدلهای زبانی را به اوج میرسانند.

شاهکار آزمایشگاه کیوتای؛ بازآموزی مدل صوتی PocketTTS با روش جدید و نرخ خطای فوقالعاده ۰.۹ درصد!
آزمایشگاه فرانسوی کیوتای با بازآموزی مدل صوتی کمحجم PocketTTS از طریق روش خلاقانه Drifting، موفق شد پیچیدگیهای محاسباتی سنگین را کنار بگذارد و به نرخ خطای خارقالعاده ۰.۹۰ درصد برسد. این مدل ۱۰۰ میلیون پارامتری به طور کامل روی CPU اجرا میشود، از شبیهسازی صدا و استریم زنده پشتیبانی میکند و با حفظ کیفیت چشمگیر، فرایند آموزش مدلهای گفتاری را بسیار سادهتر و بهینهتر کرده است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.