پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شرکت xAI از مدل Grok Voice Transcribe 2.0 با نصف خطای نسخه قبل و قیمت ثابت رونمایی کرد

انتشار:۲۸ شهریور ۱۴۰۵(۱ هفته پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

شرکت xAI از مدل جدید Grok Voice Transcribe 2.0 رونمایی کرد؛ مدلی که در میان ۳۲ سیستم تبدیل گفتار به متن در بنچمارک Artificial Analysis رتبه نخست را کسب کرده است.

شرکت xAI از مدل Grok Voice Transcribe 2.0 با نصف خطای نسخه قبل و قیمت ثابت رونمایی کرد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • شرکت xAI از مدل صوتی Grok Voice Transcribe 2.0 با نصف خطای نسخه پیشین و پشتیبانی از ده‌ها زبان رونمایی کرد.
  • این مدل در پردازش دسته‌ای و استریمینگ قیمت‌گذاری مشابه قبل داشته و ویژگی‌هایی نظیر تفکیک گوینده و تشخیص نوبت را ارائه می‌دهد.
  • با کسب رتبه نخست در بنچمارک Artificial Analysis، شرکت‌هایی نظیر Atlassian در حال حاضر از این سرویس برای پردازش ویدئوهای Loom و ارسال آن‌ها به ایجنت‌های کدنویسی استفاده می‌کنند.

رونمایی از Grok Voice Transcribe 2.0 با قیمت ثابت

شرکت xAI از Grok Voice Transcribe 2.0، مدل تبدیل گفتار به متن خود برای فایل‌های صوتی ضبط‌شده و زنده، رونمایی کرد. این شرکت قیمت‌گذاری را برای پردازش دسته‌ای در سطح ۰.۱۰ دلار به ازای هر ساعت صوت و ۰.۲۰ دلار برای پخش زنده (استریمینگ) ثابت نگه داشته است. این قیمت‌ها شامل ویژگی‌هایی نظیر تفکیک گوینده، برچسب‌های زمانی و سوگیری کلمات کلیدی می‌شود. کاربرانی که پیش‌تر از Speech-to-Text API استفاده می‌کردند، می‌توانند بدون نیاز به تغییر در کدها، به این مدل جدید مهاجرت کنند.

در زمان عرضه، مدل Transcribe 2.0 از نظر دقت در میان ۳۲ مدل استریمینگ در جدول رتبه‌بندی عمومی Artificial Analysis جایگاه نخست را به خود اختصاص داده است. همچنین بر اساس گزارش xAI، این مدل در ارزیابی‌های داخلی و در شرایط واقعی، تقریباً نصف نسخه قبلی یعنی Transcribe 1.0 خطا دارد.

صوت‌های چالش‌برانگیز، عامل اصلی پیشرفت

شرکت xAI این مدل را روی چهار مجموعه داده داخلی برگرفته از ترافیک واقعی آزمایش کرده است؛ این داده‌ها شامل تماس‌های پشتیبانی مشتریان، مکالمات با Grok، اطلاعات هویتی گفتاری مانند کدهای حساب و آدرس‌های ایمیل، و دستورات کوتاه چندزبانه می‌شود. مدل Transcribe 2.0 در تمام این چهار مجموعه داده از نسخه پیشین خود پیشی گرفت و در پردازش صوت‌های تلفنی، بالاتر از تمام مدل‌های آزمایش‌شده توسط این شرکت قرار گرفت.

نرخ خطای کلمه یا WER، میزان کلمات اضافه‌شده، جاافتاده و نادرست رونویسی‌شده را در مقایسه با متن مرجع اندازه‌گیری می‌کند. امتیاز پایین‌تر در این شاخص به معنای خطای کمتر است. در شرایطی که فایل صوتی حاوی نام‌ها، شناسه‌ها، اصطلاحات فنی یا دستورات باشد، تفاوت چند درصدی در این نرخ می‌تواند تأثیر چشمگیری بر سیستم‌های وابسته داشته باشد.

بیشترین پیشرفت گزارش‌شده مربوط به عبارات کوتاه چندزبانه بوده است. Transcribe 2.0 از ده‌ها زبان پشتیبانی می‌کند، زبان را به صورت خودکار تشخیص می‌دهد و توانایی مدیریت تغییر زبان در یک فایل صوتی را دارد. در بنچمارک عبارات کوتاه xAI، نرخ WER از ۲۰.۶ درصد به ۶.۸ درصد کاهش یافته که نشان‌دهنده کاهش نسبی ۶۷ درصدی است. این آزمایش‌ها ورودی‌های کوتاهی نظیر دستورات صوتی در خودروها و درخواست‌ها از اسپیکرهای هوشمند را هدف قرار می‌دهند؛ مواردی که مدل، فایل صوتی بسیار کوتاهی برای تشخیص زبان در اختیار دارد.

امکانات جامع برای محیط‌های عملیاتی

رابط برنامه‌نویسی اپلیکیشن (API) این سرویس شامل کنترل‌های اصلی مورد نیاز برای پردازش متن و برنامه‌های صوتی درنگ‌نگام است:

  • حالت‌های دسته‌ای و استریمینگ برای فایل‌های آپلودشده، لینک‌ها و صوت زنده
  • برچسب‌های زمانی در سطح کلمه همراه با امتیاز اطمینان برای هر واژه
  • تفکیک گوینده (Speaker Diarization) برای برچسب‌گذاری گویندگان بدون هزینه اضافی
  • رونویسی چندکاناله برای حداکثر هشت کانال با پردازش مستقل
  • سوگیری کلمات کلیدی برای حداکثر ۱۰۰ اصطلاح تخصصی در هر درخواست
  • عادی‌سازی متن برای اعداد، تاریخ‌ها، ارزها و آدرس‌های ایمیل
  • حذف کلمات پرکننده (Filler-word) برای تولید متون پاک‌تر
  • تشخیص نوبت صحبت برای کمک به ایجنت‌های صوتی جهت تشخیص پایان صحبت کاربر
حالت
ورودی
قیمت به ازای هر ساعت صوت
دسته‌ای (Batch)
فایل‌ها یا لینک‌ها
۰.۱۰ دلار
استریمینگ
صوت زنده
۰.۲۰ دلار

ثابت نگه‌داشتن نسخه ۱.۰ پیش از تغییرات پیش‌فرض

شرکت xAI قصد دارد در هفته‌های آینده، Transcribe 2.0 را به عنوان مدل پیش‌فرض Speech-to-Text تعیین کرده و نسخه ۱.۰ را از رده خارج کند. یکپارچه‌سازی‌هایی که به یک نسخه خاص محدود نشده باشند، با اعمال این تغییر به صورت خودکار مدل جدید را دریافت خواهند کرد. با این حال، تاریخ دقیق از کار افتادن نسخه ۱.۰ هنوز مشخص نشده است.

تیم‌های توسعه که نیازمند یک انتقال کنترل‌شده هستند، می‌توانند در حین آزمایش نسخه جدید، از شناسه grok-voice-transcribe-1.0 استفاده کنند. یک ارزیابی جامع باید مواردی نظیر اصطلاحات تخصصی، صوت‌های نویزدار، هم‌پوشانی صدای گویندگان، تاخیر در پاسخگویی، کیفیت تفکیک گوینده و هرگونه شناسه‌ای که نرم‌افزارهای وابسته باید به دقت پردازش کنند را در بر گیرد.

تأثیر ترافیک واقعی در آموزش مدل

مدل Transcribe 2.0 از مدل پایه صوتی به کار رفته در Grok Voice قدرت می‌گیرد. بنا بر اعلام xAI، سیستم‌های مرتبط روزانه ده‌ها هزار تماس پشتیبانی مشتری را پردازش می‌کنند، میلیون‌ها ساعت روایت ویدئویی را به متن برمی‌گردانند و دستیار Grok را در خودروهای Tesla اجرا می‌کنند.

به گفته xAI، داده‌های آموزشی این شرکت شامل فایل‌های صوتی نویزدار و چندزبانه است که از محیط‌های متنوعی جمع‌آوری شده‌اند و سپس تحت مراحل پس‌آموزش قرار گرفته‌اند. این ترکیب داده‌ها، شرایطی نظیر کیفیت ۸ کیلوهرتز مراکز تماس، افت کیفیت ناشی از فشرده‌سازی، نویز پس‌زمینه و هم‌پوشانی گفتار را هدف قرار می‌دهد؛ مواردی که عموماً نقاط ضعف پنهان‌شده در ضبط‌های استودیویی باکیفیت را نمایان می‌سازند.

انتقال متون Loom به محیط Cursor

شرکت xAI از Atlassian به عنوان مشتری اولیه Transcribe 2.0 نام برده است. طبق گزارش‌ها، Atlassian این سیستم را دقیق‌تر از سرویس قبلی خود ارزیابی کرده و در حال حاضر از آن برای رونویسی ویدئوهای پلتفرم Loom بهره می‌برد.

در روند کاری به نمایش گذاشته شده، یک درخواست تغییر ضبط‌شده در Loom به متن تبدیل می‌شود، سپس این متن در اختیار محیط برنامه‌نویسی Cursor قرار می‌گیرد تا ایجنت هوش مصنوعی، تغییرات درخواستی را روی کدها اعمال کند. خطاهای رونویسی در نام متغیرها، شماره حساب‌ها یا دستورالعمل‌های فنی می‌تواند به طور مستقیم به کدهای تولیدشده یا عملکردهای خودکار منتقل شود؛ همین مسئله، اهمیت بالای دقت در تشخیص اطلاعات هویتی و دستورات کوتاه را در روند کاری ایجنت‌ها نشان می‌دهد.

لزوم ارزیابی داخلی فراتر از جایگاه نخست بنچمارک‌ها

بررسی‌ها و مقایسه‌های انجام‌شده توسط xAI شامل مدل‌های نام‌آشنایی چون ElevenLabs Scribe v2، Deepgram Nova-3، Google Chirp 3، Azure Speech to Text، AssemblyAI Universal-3.5 و سیستم رونویسی زنده OpenAI می‌شود. اگرچه نتایج بنچمارک‌های عمومی معیار مفیدی ارائه می‌دهند، اما چهار مجموعه داده عملیاتی xAI همچنان محرمانه هستند و امکان بررسی مستقل آن‌ها وجود ندارد.

همچنین نتایج مقایسه‌ای بین شرکت‌های مختلف، بسته به زبان، شرایط صوتی، تنظیمات تاخیر، قوانین قالب‌بندی و روش‌های امتیازدهی متفاوت است. توسعه‌دهندگان می‌توانند این مدل را در پنل کاربری xAI مورد ارزیابی قرار داده و جزئیاتی نظیر پارامترهای درخواست، محدودیت‌ها و راهنمای یکپارچه‌سازی را در مستندات API مطالعه کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر