شرکت xAI از مدل Grok Voice Transcribe 2.0 با نصف خطای نسخه قبل و قیمت ثابت رونمایی کرد
شرکت xAI از مدل جدید Grok Voice Transcribe 2.0 رونمایی کرد؛ مدلی که در میان ۳۲ سیستم تبدیل گفتار به متن در بنچمارک Artificial Analysis رتبه نخست را کسب کرده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- شرکت xAI از مدل صوتی Grok Voice Transcribe 2.0 با نصف خطای نسخه پیشین و پشتیبانی از دهها زبان رونمایی کرد.
- این مدل در پردازش دستهای و استریمینگ قیمتگذاری مشابه قبل داشته و ویژگیهایی نظیر تفکیک گوینده و تشخیص نوبت را ارائه میدهد.
- با کسب رتبه نخست در بنچمارک Artificial Analysis، شرکتهایی نظیر Atlassian در حال حاضر از این سرویس برای پردازش ویدئوهای Loom و ارسال آنها به ایجنتهای کدنویسی استفاده میکنند.
رونمایی از Grok Voice Transcribe 2.0 با قیمت ثابت
شرکت xAI از Grok Voice Transcribe 2.0، مدل تبدیل گفتار به متن خود برای فایلهای صوتی ضبطشده و زنده، رونمایی کرد. این شرکت قیمتگذاری را برای پردازش دستهای در سطح ۰.۱۰ دلار به ازای هر ساعت صوت و ۰.۲۰ دلار برای پخش زنده (استریمینگ) ثابت نگه داشته است. این قیمتها شامل ویژگیهایی نظیر تفکیک گوینده، برچسبهای زمانی و سوگیری کلمات کلیدی میشود. کاربرانی که پیشتر از Speech-to-Text API استفاده میکردند، میتوانند بدون نیاز به تغییر در کدها، به این مدل جدید مهاجرت کنند.
در زمان عرضه، مدل Transcribe 2.0 از نظر دقت در میان ۳۲ مدل استریمینگ در جدول رتبهبندی عمومی Artificial Analysis جایگاه نخست را به خود اختصاص داده است. همچنین بر اساس گزارش xAI، این مدل در ارزیابیهای داخلی و در شرایط واقعی، تقریباً نصف نسخه قبلی یعنی Transcribe 1.0 خطا دارد.
صوتهای چالشبرانگیز، عامل اصلی پیشرفت
شرکت xAI این مدل را روی چهار مجموعه داده داخلی برگرفته از ترافیک واقعی آزمایش کرده است؛ این دادهها شامل تماسهای پشتیبانی مشتریان، مکالمات با Grok، اطلاعات هویتی گفتاری مانند کدهای حساب و آدرسهای ایمیل، و دستورات کوتاه چندزبانه میشود. مدل Transcribe 2.0 در تمام این چهار مجموعه داده از نسخه پیشین خود پیشی گرفت و در پردازش صوتهای تلفنی، بالاتر از تمام مدلهای آزمایششده توسط این شرکت قرار گرفت.
نرخ خطای کلمه یا WER، میزان کلمات اضافهشده، جاافتاده و نادرست رونویسیشده را در مقایسه با متن مرجع اندازهگیری میکند. امتیاز پایینتر در این شاخص به معنای خطای کمتر است. در شرایطی که فایل صوتی حاوی نامها، شناسهها، اصطلاحات فنی یا دستورات باشد، تفاوت چند درصدی در این نرخ میتواند تأثیر چشمگیری بر سیستمهای وابسته داشته باشد.
بیشترین پیشرفت گزارششده مربوط به عبارات کوتاه چندزبانه بوده است. Transcribe 2.0 از دهها زبان پشتیبانی میکند، زبان را به صورت خودکار تشخیص میدهد و توانایی مدیریت تغییر زبان در یک فایل صوتی را دارد. در بنچمارک عبارات کوتاه xAI، نرخ WER از ۲۰.۶ درصد به ۶.۸ درصد کاهش یافته که نشاندهنده کاهش نسبی ۶۷ درصدی است. این آزمایشها ورودیهای کوتاهی نظیر دستورات صوتی در خودروها و درخواستها از اسپیکرهای هوشمند را هدف قرار میدهند؛ مواردی که مدل، فایل صوتی بسیار کوتاهی برای تشخیص زبان در اختیار دارد.
امکانات جامع برای محیطهای عملیاتی
رابط برنامهنویسی اپلیکیشن (API) این سرویس شامل کنترلهای اصلی مورد نیاز برای پردازش متن و برنامههای صوتی درنگنگام است:
- حالتهای دستهای و استریمینگ برای فایلهای آپلودشده، لینکها و صوت زنده
- برچسبهای زمانی در سطح کلمه همراه با امتیاز اطمینان برای هر واژه
- تفکیک گوینده (Speaker Diarization) برای برچسبگذاری گویندگان بدون هزینه اضافی
- رونویسی چندکاناله برای حداکثر هشت کانال با پردازش مستقل
- سوگیری کلمات کلیدی برای حداکثر ۱۰۰ اصطلاح تخصصی در هر درخواست
- عادیسازی متن برای اعداد، تاریخها، ارزها و آدرسهای ایمیل
- حذف کلمات پرکننده (Filler-word) برای تولید متون پاکتر
- تشخیص نوبت صحبت برای کمک به ایجنتهای صوتی جهت تشخیص پایان صحبت کاربر
حالت | ورودی | قیمت به ازای هر ساعت صوت |
|---|---|---|
دستهای (Batch) | فایلها یا لینکها | ۰.۱۰ دلار |
استریمینگ | صوت زنده | ۰.۲۰ دلار |
ثابت نگهداشتن نسخه ۱.۰ پیش از تغییرات پیشفرض
شرکت xAI قصد دارد در هفتههای آینده، Transcribe 2.0 را به عنوان مدل پیشفرض Speech-to-Text تعیین کرده و نسخه ۱.۰ را از رده خارج کند. یکپارچهسازیهایی که به یک نسخه خاص محدود نشده باشند، با اعمال این تغییر به صورت خودکار مدل جدید را دریافت خواهند کرد. با این حال، تاریخ دقیق از کار افتادن نسخه ۱.۰ هنوز مشخص نشده است.
تیمهای توسعه که نیازمند یک انتقال کنترلشده هستند، میتوانند در حین آزمایش نسخه جدید، از شناسه grok-voice-transcribe-1.0 استفاده کنند. یک ارزیابی جامع باید مواردی نظیر اصطلاحات تخصصی، صوتهای نویزدار، همپوشانی صدای گویندگان، تاخیر در پاسخگویی، کیفیت تفکیک گوینده و هرگونه شناسهای که نرمافزارهای وابسته باید به دقت پردازش کنند را در بر گیرد.
تأثیر ترافیک واقعی در آموزش مدل
مدل Transcribe 2.0 از مدل پایه صوتی به کار رفته در Grok Voice قدرت میگیرد. بنا بر اعلام xAI، سیستمهای مرتبط روزانه دهها هزار تماس پشتیبانی مشتری را پردازش میکنند، میلیونها ساعت روایت ویدئویی را به متن برمیگردانند و دستیار Grok را در خودروهای Tesla اجرا میکنند.
به گفته xAI، دادههای آموزشی این شرکت شامل فایلهای صوتی نویزدار و چندزبانه است که از محیطهای متنوعی جمعآوری شدهاند و سپس تحت مراحل پسآموزش قرار گرفتهاند. این ترکیب دادهها، شرایطی نظیر کیفیت ۸ کیلوهرتز مراکز تماس، افت کیفیت ناشی از فشردهسازی، نویز پسزمینه و همپوشانی گفتار را هدف قرار میدهد؛ مواردی که عموماً نقاط ضعف پنهانشده در ضبطهای استودیویی باکیفیت را نمایان میسازند.
انتقال متون Loom به محیط Cursor
شرکت xAI از Atlassian به عنوان مشتری اولیه Transcribe 2.0 نام برده است. طبق گزارشها، Atlassian این سیستم را دقیقتر از سرویس قبلی خود ارزیابی کرده و در حال حاضر از آن برای رونویسی ویدئوهای پلتفرم Loom بهره میبرد.
در روند کاری به نمایش گذاشته شده، یک درخواست تغییر ضبطشده در Loom به متن تبدیل میشود، سپس این متن در اختیار محیط برنامهنویسی Cursor قرار میگیرد تا ایجنت هوش مصنوعی، تغییرات درخواستی را روی کدها اعمال کند. خطاهای رونویسی در نام متغیرها، شماره حسابها یا دستورالعملهای فنی میتواند به طور مستقیم به کدهای تولیدشده یا عملکردهای خودکار منتقل شود؛ همین مسئله، اهمیت بالای دقت در تشخیص اطلاعات هویتی و دستورات کوتاه را در روند کاری ایجنتها نشان میدهد.
لزوم ارزیابی داخلی فراتر از جایگاه نخست بنچمارکها
بررسیها و مقایسههای انجامشده توسط xAI شامل مدلهای نامآشنایی چون ElevenLabs Scribe v2، Deepgram Nova-3، Google Chirp 3، Azure Speech to Text، AssemblyAI Universal-3.5 و سیستم رونویسی زنده OpenAI میشود. اگرچه نتایج بنچمارکهای عمومی معیار مفیدی ارائه میدهند، اما چهار مجموعه داده عملیاتی xAI همچنان محرمانه هستند و امکان بررسی مستقل آنها وجود ندارد.
همچنین نتایج مقایسهای بین شرکتهای مختلف، بسته به زبان، شرایط صوتی، تنظیمات تاخیر، قوانین قالببندی و روشهای امتیازدهی متفاوت است. توسعهدهندگان میتوانند این مدل را در پنل کاربری xAI مورد ارزیابی قرار داده و جزئیاتی نظیر پارامترهای درخواست، محدودیتها و راهنمای یکپارچهسازی را در مستندات API مطالعه کنند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.