استارتاپ Sarvam از مدل تبدیل گفتار Saaras V4 برای ۲۲ زبان هندی رونمایی کرد
استارتاپ هندی Sarvam از مدل تبدیل گفتار به متن Saaras V4 رونمایی کرد؛ سیستمی مبتنی بر یک مدل زبانی ۳ میلیارد پارامتری هایبرید که از تمام ۲۲ زبان رسمی هند و زبان انگلیسی پشتیبانی میکند و قابلیت پردازش گفتارهای ترکیبی را دارد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- رونمایی از مدل صوتی Saaras V4 با ترکیب انکودر پیشرفته و مدل زبانی ۳ میلیارد پارامتری مبتنی بر معماری State-Space
- پشتیبانی جامع از تمامی ۲۲ زبان رسمی هند و زبان انگلیسی همراه با ارائه ۵ حالت خروجی متنی مجزا
- ثبت عملکرد رقابتی در برابر مدلهای معروفی چون GPT-4o Transcribe و Deepgram Nova-3 در فایلهای صوتی پرنویز
- تاخیر استریم زیر ۱۵۰ میلیثانیه برای دریافت نخستین توکن و یکپارچگی با فریمورکهای ساخت ایجنتهای صوتی
رونمایی Sarvam از مدل Saaras V4 برای تشخیص گفتار چندزبانه
استارتاپ Sarvam از سیستم تبدیل گفتار به متن Saaras V4 رونمایی کرده است؛ سامانهای که یک انکودر صوتی را با Sarvam-3B، مدل زبانی هایبرید سه میلیارد پارامتری مبتنی بر معماری State-Space که از پایه آموزش دیده، پیوند میزند. این مدل از زبان انگلیسی، تمامی ۲۲ زبان موجود در فهرست هشتم قانون اساسی هند، گفتارهای ترکیبی چندزبانه (Code-mixed)، فایلهای ضبطشده با نویز بالا، شناسایی خودکار زبان و پنج قالب خروجی قابل انتخاب پشتیبانی میکند.
به گفته Sarvam، ده مورد از این زبانهای هندی پیش از این هیچ سرویس تجاری فعالی برای تشخیص خودکار گفتار نداشتند. این شرکت همچنین مدعی است که در مقایسه میان هفت بنچمارک انگلیسی، کمترین میانگین نرخ خطای کلمات (WER) را نسبت به سایر سیستمهای ارزیابیشده ثبت کرده است. این ویژگیها، Saaras V4 را به گزینهای کاربردی برای توسعهدهندگانی تبدیل میکند که به کاربران چندزبانه هندی خدمات میدهند و همزمان به پشتیبانی گسترده از زبان انگلیسی نیاز دارند.
از شکل موج تا توکن
مدل Saaras V4 صدا را طی سه مرحله به متن تبدیل میکند؛ مراحلی که با هدف حفظ جزئیات آکوستیک و همزمان فشردهسازی فایلهای ضبطشده طولانی طراحی شدهاند:
- انکودینگ صوتی (Audio encoding): انکودر، شکل موج صوتی را به امبدینگهایی تبدیل میکند که ویژگیهای آوایی و آکوستیک را بازنمایی میکنند.
- فشردهسازی زمانی (Temporal compression): یک مبدل کاهش نرخ نمونهبرداری (Downsampling adapter)، توالی صوتی را در امتداد محور زمان کوتاهتر کرده و آن را به فضای امبدینگ مدل زبانی نگاشت میدهد؛ این رویکرد حجم زمینه مورد نیاز برای فایلهای صوتی طولانی را کاهش میدهد.
- دیکودینگ خودبازگشتی (Autoregressive decoding): مدل Sarvam-3B ویژگیهای نگاشتشده صوتی را در کنار توکنهای پرامپت میخواند، توکن رونویسی متن را تولید میکند و سپس آن را به مرحله بعدی دیکودینگ هدایت مینماید.
معماری هایبرید State-Space در دیکودر این مدل، وضعیت پنهان (Hidden State) فشردهای را در طول توالی حفظ میکند و در عین حال بخشهای منتخبی از مکانیزم توجه (Attention) را به کار میگیرد. مکانیزم توجه کامل، توکنها را در کل توالی مقایسه میکند که با افزایش طول ورودی، مصرف حافظه و بار پردازشی را به شکل تصاعدی بالا میبرد. لایههای State-Space مقیاسپذیری این پردازش را نزدیک به خطی نگه میدارند؛ ویژگی مهمی که این معماری را برای فایلهای صوتی طولانی بسیار مناسب میسازد.
یک مدل، پنج قالب متنی مختلف
در هر درخواست میتوان یکی از پنج حالت نمایش متنی را تعیین کرد و مدل شکل انتخابی را بهطور مستقیم در مرحله استنتاج تولید میکند:
حالت | خروجی | کاربرد معمول |
|---|---|---|
verbatim | متن کلمهبهکلمه به خط اصلی زبان | بایگانی اسناد قانونی و بازبینیهای دقیق |
transcribe | متن به خط اصلی زبان همراه با استانداردسازی تاریخها و اعداد | جستوجو، سوابق مشتریان و خلاصهسازی |
codemix | متن به خط اصلی همراه با حفظ کلمات انگلیسی در خط لاتین | متون خوانای هینگلیش و سایر زبانهای ترکیبی |
translit | متن کامل گفتار با الفبای رومی | رابطهای کاربری چت و کاربرانی که زبان را بر اساس تلفظ آوایی میخوانند |
translate | ترجمه انگلیسی گفتار | تحلیلهای بینزبانی و بازبینی متنی |
تولید مستقیم این قالبها نیاز به سرویسهای جداگانه برای نرمالسازی، ترجمه و نویسهگردانی را رفع میکند و مانع از انتقال خطاهای یک مرحله به مراحل بعدی میشود. رابط ارائهشده این قابلیت را در قالب یک پارامتر برای حالت خروجی در اختیار برنامهنویسان قرار میدهد. سرویسهایی که به چند نمایش متنی همزمان از یک فایل صوتی نیاز دارند، باید بررسی کنند که آیا این سامانه امکان دریافت همزمان چند حالت را دارد یا نیازمند ارسال درخواستهای مجزا است.
ادعاها، شاخصها و نکات قابلتوجه
معیار نرخ خطای کلمات (WER) تعداد جانشینیها، حذفها و درجها را در مقایسه با متن مرجع محاسبه میکند و هرچه امتیاز آن پایینتر باشد، به معنای انطباق دقیقتر متن است. شرکت Sarvam برای ارزیابی زبانهای شبهقاره هند از معیار LLM-WER نیز بهره میبرد؛ معیاری که در آن از یک مدل زبانی برای سنجش تغییر معنا یا همارزی املایی و نگارشی استفاده میشود تا تفاوتهای املایی جزئی و بیضرر باعث افزایش کاذب نرخ خطا نشوند.
ارزیابی | نتیجه اعلامشده توسط Sarvam |
|---|---|
تشخیص گفتار انگلیسی | کمترین میانگین WER در بین سیستمهای ارزیابیشده در بنچمارکهای AMI، GigaSpeech، LibriSpeech Clean، LibriSpeech Other، SPGISpeech، VoxPopuli و Svarah. |
شناسایی زبان | خطای شناسایی ۵٫۲۲ درصدی در تمامی ۲۲ زبان هندی و ۲٫۹ درصدی در ۱۰ زبان پرکاربرد بر اساس دادگان اعتبارسنجیشده IndicVoices. |
فایلهای صوتی پرنویز | نرخ خطای کمتر از نصف در مقایسه با Nova-3 از شرکت Deepgram و GPT-4o Transcribe در بنچمارک Kathbath Noisy تحت شرایط فشردهسازی، قطعی صوت و نویز پسزمینه. |
پرامپت اصطلاحات کلیدی | نرخ خطای ۱۶٫۰۳ درصدی WER در حالت کلیدواژه سطح ۵ (L5) در بنچمارک ai4bharat/IndicContextEval مرتبط با رویداد Interspeech 2026. |
آمارهای اعلامشده مستقیماً از سوی سازنده ارائه شدهاند و میانگین WER ممکن است تفاوتهای بزرگ میان لهجهها، زبانها، شرایط ضبط و زمینههای موضوعی گوناگون را بپوشاند. همچنین معیار LLM-WER به داور معنایی و پرامپت ارزیابی وابسته است که تکرارپذیری نتایج آن را نسبت به WER استاندارد دشوارتر میکند؛ بنابراین در ارزیابیهای عملیاتی و مقایسه سرویسدهندگان، باید فایلهای صوتی یکسان، قوانین رونویسی مشخص، تنظیمات زبانی مشابه و فهرست کلیدواژههای یکسانی به کار گرفته شوند.
قابلیت پرامپت اصطلاحات کلیدی (Keyterm Prompting) به نرمافزارها امکان میدهد اسامی خاص، برندها، سرنامها و واژگان تخصصی حوزه مدنظر را پیش از شروع تبدیل گفتار به مدل ارسال کنند؛ در نتیجه دیکودر در نقاط مبهم صوتی، احتمال بیشتری به این عبارات تخصیص میدهد. برای نمونه، در یک فایل صوتی میدانی به زبان گجراتی، افزودن فهرستی شامل ۲۴ کلیدواژه سبب شد یک خروجی اشتباه و بیمعنی به معادل درست واژه «پهپاد» به زبان گجراتی تبدیل شود.
سه روش برای استقرار در محیطهای عملیاتی
رابط کاربری | محدودیتها و ویژگیها | بهترین کاربرد |
|---|---|---|
مستندات REST API | فایلهای صوتی کوتاهتر از ۳۰ ثانیه | آپلودها، پیامهای صوتی کوتاه و رونویسی همگام (Synchronous) |
Batch API | فایلهای صوتی تا ۲ ساعت همراه با قابلیت اختیاری تفکیک گویندگان (Speaker Diarization) | تماسها، جلسات کاری، مصاحبهها و بایگانی رسانهای |
WebSocket | استریم صدا و دریافت تدریجی نتایج رونویسی | ایجنتهای صوتی، زیرنویسهای زنده و رابطهای بلادرنگ (Real-time) |
شرکت Sarvam ابزارهای توسعه نرمافزار (SDK) را برای پایتون نسخه ۳٫۹ به بالا و Node.js نسخه ۱۸ به بالا عرضه کرده و امکان یکپارچهسازی با Vercel AI SDK و فریمورکهای ایجنتمحور مانند LiveKit Agents و Pipecat Agents را فراهم ساخته است. جابهجایی میان حالتهای مختلف رونویسی نیز صرفاً با تغییر پارامتر خروجی در درخواست انجام میپذیرد.
تیم Sarvam زمان لازم برای دریافت نخستین توکن در حالت استریم را زیر ۱۵۰ میلیثانیه اعلام کرده است؛ مزیتی که به اپلیکیشنهای صوتی امکان میدهد پیش از پایان کل پردازش، کار روی متن دریافتی را آغاز کنند. همچنین به گفته این شرکت، فایلهای صوتی چنددقیقهای در کمتر از یک ثانیه پردازش میشوند. البته تاخیر سرتاسری (End-to-End Latency) به عواملی چون فاصله شبکه، بافر صدا، تشخیص پایان گفتار، همزمانی درخواستها و بار سرور بستگی دارد و تیمهای توسعه باید تاخیر واقعی را تحت ترافیک واقعی بسنجند.
کاربردها و جایگاه مدل در بازار
مدل Saaras V4 مشخصاً برای ایجنتهای صوتی، سامانههای مراکز تماس، جمعآوری دادههای میدانی، پیادهسازی متنی فایلهای رسانهای و پلتفرمهای تحلیلی طراحی شده است که به کاربران هندی با زبانهای گوناگون سرویس میدهند. تلفیق شناسایی خودکار زبان، رونویسی گفتارهای ترکیبی، ارائه خروجی به خط اصلی، نویسهگردانی، ترجمه و تزریق اصطلاحات کلیدی میتواند جایگزین چندین بخش مجزا در خطوط لوله پردازش صوت فعلی شود.
اپلیکیشنهایی که تنها با زبان انگلیسی سر و کار دارند میتوانند عملکرد Saaras V4 را با سرویسهای مطرحی همچون Deepgram، سرویس ElevenLabs Scribe و GPT-4o Transcribe با استفاده از دادههای صوتی خود بسنجند. نتایج حاصل از هفت بنچمارک نشاندهنده دقت رقابتی این مدل در زبان انگلیسی است، هرچند انتخاب ارائهدهنده نهایی به عواملی چون تاخیر، تفکیک گویندگان، ابزارهای کنترلی، موقعیت جغرافیایی سرورها و هزینهها وابسته خواهد بود.
چکلیست ارزیابی پیش از راهاندازی
ارزیابی عملیاتی پیش از استقرار نهایی باید شرایطی را پوشش دهد که امتیازهای کلی بنچمارکها معمولاً پنهان میکنند:
- دقت معنایی و نرخ WER برای تکتک زبانها، لهجهها و خطوط مورد نیاز
- مکالمات چندزبانه با جابهجایی طبیعی میان زبانها
- میزان خطای شناسایی زبان در عبارتهای کوتاه یا مبهم
- عملکرد پرامپت کلمات کلیدی برای نامها، اصطلاحات تجاری، سرنامها و واژگان تخصصی به خط اصلی
- کیفیت عملکرد تحت فشردهسازی، نویز محیطی، قطعی صدا و مکالمات پسزمینه
- تاخیر تا اولین توکن و تاخیر کل در ترافیکهای همزمان بالا
- دقت تفکیک گویندگان در مکالمات پربسامد و همپوشانی صدای افراد
- نحوه استانداردسازی تاریخها، اعداد، مبالغ ارزی و علائم نگارشی
در این اطلاعیه جزئیات قیمتگذاری مدل منتشر نشده است؛ بنابراین تعرفهها، سهمیهها، سیاستهای نگهداری داده، مناطق پردازش و کنترلهای امنیتی باید پیش از پیادهسازی نهایی، از طریق پنل کاربری و مستندات رسمی Sarvam بررسی شوند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.