پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

استارتاپ Sarvam از مدل تبدیل گفتار Saaras V4 برای ۲۲ زبان هندی رونمایی کرد

انتشار:۳ مهر ۱۴۰۵(۳ روز پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ هندی Sarvam از مدل تبدیل گفتار به متن Saaras V4 رونمایی کرد؛ سیستمی مبتنی بر یک مدل زبانی ۳ میلیارد پارامتری هایبرید که از تمام ۲۲ زبان رسمی هند و زبان انگلیسی پشتیبانی می‌کند و قابلیت پردازش گفتارهای ترکیبی را دارد.

استارتاپ Sarvam از مدل تبدیل گفتار Saaras V4 برای ۲۲ زبان هندی رونمایی کرد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • رونمایی از مدل صوتی Saaras V4 با ترکیب انکودر پیشرفته و مدل زبانی ۳ میلیارد پارامتری مبتنی بر معماری State-Space
  • پشتیبانی جامع از تمامی ۲۲ زبان رسمی هند و زبان انگلیسی همراه با ارائه ۵ حالت خروجی متنی مجزا
  • ثبت عملکرد رقابتی در برابر مدلهای معروفی چون GPT-4o Transcribe و Deepgram Nova-3 در فایلهای صوتی پرنویز
  • تاخیر استریم زیر ۱۵۰ میلیثانیه برای دریافت نخستین توکن و یکپارچگی با فریمورکهای ساخت ایجنتهای صوتی

رونمایی Sarvam از مدل Saaras V4 برای تشخیص گفتار چندزبانه

استارتاپ Sarvam از سیستم تبدیل گفتار به متن Saaras V4 رونمایی کرده است؛ سامانه‌ای که یک انکودر صوتی را با Sarvam-3B، مدل زبانی هایبرید سه میلیارد پارامتری مبتنی بر معماری State-Space که از پایه آموزش دیده، پیوند می‌زند. این مدل از زبان انگلیسی، تمامی ۲۲ زبان موجود در فهرست هشتم قانون اساسی هند، گفتارهای ترکیبی چندزبانه (Code-mixed)، فایل‌های ضبط‌شده با نویز بالا، شناسایی خودکار زبان و پنج قالب خروجی قابل انتخاب پشتیبانی می‌کند.

به گفته Sarvam، ده مورد از این زبان‌های هندی پیش از این هیچ سرویس تجاری فعالی برای تشخیص خودکار گفتار نداشتند. این شرکت همچنین مدعی است که در مقایسه میان هفت بنچمارک انگلیسی، کمترین میانگین نرخ خطای کلمات (WER) را نسبت به سایر سیستم‌های ارزیابی‌شده ثبت کرده است. این ویژگی‌ها، Saaras V4 را به گزینه‌ای کاربردی برای توسعه‌دهندگانی تبدیل می‌کند که به کاربران چندزبانه هندی خدمات می‌دهند و هم‌زمان به پشتیبانی گسترده از زبان انگلیسی نیاز دارند.

از شکل موج تا توکن

مدل Saaras V4 صدا را طی سه مرحله به متن تبدیل می‌کند؛ مراحلی که با هدف حفظ جزئیات آکوستیک و هم‌زمان فشرده‌سازی فایل‌های ضبط‌شده طولانی طراحی شده‌اند:

  1. انکودینگ صوتی (Audio encoding): انکودر، شکل موج صوتی را به امبدینگ‌هایی تبدیل می‌کند که ویژگی‌های آوایی و آکوستیک را بازنمایی می‌کنند.
  2. فشرده‌سازی زمانی (Temporal compression): یک مبدل کاهش نرخ نمونه‌برداری (Downsampling adapter)، توالی صوتی را در امتداد محور زمان کوتاه‌تر کرده و آن را به فضای امبدینگ مدل زبانی نگاشت می‌دهد؛ این رویکرد حجم زمینه مورد نیاز برای فایل‌های صوتی طولانی را کاهش می‌دهد.
  3. دیکودینگ خودبازگشتی (Autoregressive decoding): مدل Sarvam-3B ویژگی‌های نگاشت‌شده صوتی را در کنار توکن‌های پرامپت می‌خواند، توکن رونویسی متن را تولید می‌کند و سپس آن را به مرحله بعدی دیکودینگ هدایت می‌نماید.

معماری هایبرید State-Space در دیکودر این مدل، وضعیت پنهان (Hidden State) فشرده‌ای را در طول توالی حفظ می‌کند و در عین حال بخش‌های منتخبی از مکانیزم توجه (Attention) را به کار می‌گیرد. مکانیزم توجه کامل، توکن‌ها را در کل توالی مقایسه می‌کند که با افزایش طول ورودی، مصرف حافظه و بار پردازشی را به شکل تصاعدی بالا می‌برد. لایه‌های State-Space مقیاس‌پذیری این پردازش را نزدیک به خطی نگه می‌دارند؛ ویژگی مهمی که این معماری را برای فایل‌های صوتی طولانی بسیار مناسب می‌سازد.

یک مدل، پنج قالب متنی مختلف

در هر درخواست می‌توان یکی از پنج حالت نمایش متنی را تعیین کرد و مدل شکل انتخابی را به‌طور مستقیم در مرحله استنتاج تولید می‌کند:

حالت
خروجی
کاربرد معمول
verbatim
متن کلمه‌به‌کلمه به خط اصلی زبان
بایگانی اسناد قانونی و بازبینی‌های دقیق
transcribe
متن به خط اصلی زبان همراه با استانداردسازی تاریخ‌ها و اعداد
جست‌وجو، سوابق مشتریان و خلاصه‌سازی
codemix
متن به خط اصلی همراه با حفظ کلمات انگلیسی در خط لاتین
متون خوانای هینگلیش و سایر زبان‌های ترکیبی
translit
متن کامل گفتار با الفبای رومی
رابط‌های کاربری چت و کاربرانی که زبان را بر اساس تلفظ آوایی می‌خوانند
translate
ترجمه انگلیسی گفتار
تحلیل‌های بین‌زبانی و بازبینی متنی

تولید مستقیم این قالب‌ها نیاز به سرویس‌های جداگانه برای نرمال‌سازی، ترجمه و نویسه‌گردانی را رفع می‌کند و مانع از انتقال خطاهای یک مرحله به مراحل بعدی می‌شود. رابط ارائه‌شده این قابلیت را در قالب یک پارامتر برای حالت خروجی در اختیار برنامه‌نویسان قرار می‌دهد. سرویس‌هایی که به چند نمایش متنی هم‌زمان از یک فایل صوتی نیاز دارند، باید بررسی کنند که آیا این سامانه امکان دریافت هم‌زمان چند حالت را دارد یا نیازمند ارسال درخواست‌های مجزا است.

ادعاها، شاخص‌ها و نکات قابل‌توجه

معیار نرخ خطای کلمات (WER) تعداد جانشینی‌ها، حذف‌ها و درج‌ها را در مقایسه با متن مرجع محاسبه می‌کند و هرچه امتیاز آن پایین‌تر باشد، به معنای انطباق دقیق‌تر متن است. شرکت Sarvam برای ارزیابی زبان‌های شبه‌قاره هند از معیار LLM-WER نیز بهره می‌برد؛ معیاری که در آن از یک مدل زبانی برای سنجش تغییر معنا یا هم‌ارزی املایی و نگارشی استفاده می‌شود تا تفاوت‌های املایی جزئی و بی‌ضرر باعث افزایش کاذب نرخ خطا نشوند.

ارزیابی
نتیجه اعلام‌شده توسط Sarvam
تشخیص گفتار انگلیسی
کمترین میانگین WER در بین سیستم‌های ارزیابی‌شده در بنچمارک‌های AMI، GigaSpeech، LibriSpeech Clean، LibriSpeech Other، SPGISpeech، VoxPopuli و Svarah.
شناسایی زبان
خطای شناسایی ۵٫۲۲ درصدی در تمامی ۲۲ زبان هندی و ۲٫۹ درصدی در ۱۰ زبان پرکاربرد بر اساس دادگان اعتبارسنجی‌شده IndicVoices.
فایل‌های صوتی پرنویز
نرخ خطای کمتر از نصف در مقایسه با Nova-3 از شرکت Deepgram و GPT-4o Transcribe در بنچمارک Kathbath Noisy تحت شرایط فشرده‌سازی، قطعی صوت و نویز پس‌زمینه.
پرامپت اصطلاحات کلیدی
نرخ خطای ۱۶٫۰۳ درصدی WER در حالت کلیدواژه سطح ۵ (L5) در بنچمارک ai4bharat/IndicContextEval مرتبط با رویداد Interspeech 2026.

آمارهای اعلام‌شده مستقیماً از سوی سازنده ارائه شده‌اند و میانگین WER ممکن است تفاوت‌های بزرگ میان لهجه‌ها، زبان‌ها، شرایط ضبط و زمینه‌های موضوعی گوناگون را بپوشاند. همچنین معیار LLM-WER به داور معنایی و پرامپت ارزیابی وابسته است که تکرارپذیری نتایج آن را نسبت به WER استاندارد دشوارتر می‌کند؛ بنابراین در ارزیابی‌های عملیاتی و مقایسه سرویس‌دهندگان، باید فایل‌های صوتی یکسان، قوانین رونویسی مشخص، تنظیمات زبانی مشابه و فهرست کلیدواژه‌های یکسانی به کار گرفته شوند.

قابلیت پرامپت اصطلاحات کلیدی (Keyterm Prompting) به نرم‌افزارها امکان می‌دهد اسامی خاص، برندها، سرنام‌ها و واژگان تخصصی حوزه مدنظر را پیش از شروع تبدیل گفتار به مدل ارسال کنند؛ در نتیجه دیکودر در نقاط مبهم صوتی، احتمال بیشتری به این عبارات تخصیص می‌دهد. برای نمونه، در یک فایل صوتی میدانی به زبان گجراتی، افزودن فهرستی شامل ۲۴ کلیدواژه سبب شد یک خروجی اشتباه و بی‌معنی به معادل درست واژه «پهپاد» به زبان گجراتی تبدیل شود.

سه روش برای استقرار در محیط‌های عملیاتی

رابط کاربری
محدودیت‌ها و ویژگی‌ها
بهترین کاربرد
مستندات REST API
فایل‌های صوتی کوتاه‌تر از ۳۰ ثانیه
آپلودها، پیام‌های صوتی کوتاه و رونویسی هم‌گام (Synchronous)
Batch API
فایل‌های صوتی تا ۲ ساعت همراه با قابلیت اختیاری تفکیک گویندگان (Speaker Diarization)
تماس‌ها، جلسات کاری، مصاحبه‌ها و بایگانی رسانه‌ای
WebSocket
استریم صدا و دریافت تدریجی نتایج رونویسی
ایجنت‌های صوتی، زیرنویس‌های زنده و رابط‌های بلادرنگ (Real-time)

شرکت Sarvam ابزارهای توسعه نرم‌افزار (SDK) را برای پایتون نسخه ۳٫۹ به بالا و Node.js نسخه ۱۸ به بالا عرضه کرده و امکان یکپارچه‌سازی با Vercel AI SDK و فریم‌ورک‌های ایجنت‌محور مانند LiveKit Agents و Pipecat Agents را فراهم ساخته است. جابه‌جایی میان حالت‌های مختلف رونویسی نیز صرفاً با تغییر پارامتر خروجی در درخواست انجام می‌پذیرد.

تیم Sarvam زمان لازم برای دریافت نخستین توکن در حالت استریم را زیر ۱۵۰ میلی‌ثانیه اعلام کرده است؛ مزیتی که به اپلیکیشن‌های صوتی امکان می‌دهد پیش از پایان کل پردازش، کار روی متن دریافتی را آغاز کنند. همچنین به گفته این شرکت، فایل‌های صوتی چنددقیقه‌ای در کمتر از یک ثانیه پردازش می‌شوند. البته تاخیر سرتاسری (End-to-End Latency) به عواملی چون فاصله شبکه، بافر صدا، تشخیص پایان گفتار، هم‌زمانی درخواست‌ها و بار سرور بستگی دارد و تیم‌های توسعه باید تاخیر واقعی را تحت ترافیک واقعی بسنجند.

کاربردها و جایگاه مدل در بازار

مدل Saaras V4 مشخصاً برای ایجنت‌های صوتی، سامانه‌های مراکز تماس، جمع‌آوری داده‌های میدانی، پیاده‌سازی متنی فایل‌های رسانه‌ای و پلتفرم‌های تحلیلی طراحی شده است که به کاربران هندی با زبان‌های گوناگون سرویس می‌دهند. تلفیق شناسایی خودکار زبان، رونویسی گفتارهای ترکیبی، ارائه خروجی به خط اصلی، نویسه‌گردانی، ترجمه و تزریق اصطلاحات کلیدی می‌تواند جایگزین چندین بخش مجزا در خطوط لوله پردازش صوت فعلی شود.

اپلیکیشن‌هایی که تنها با زبان انگلیسی سر و کار دارند می‌توانند عملکرد Saaras V4 را با سرویس‌های مطرحی همچون Deepgram، سرویس ElevenLabs Scribe و GPT-4o Transcribe با استفاده از داده‌های صوتی خود بسنجند. نتایج حاصل از هفت بنچمارک نشان‌دهنده دقت رقابتی این مدل در زبان انگلیسی است، هرچند انتخاب ارائه‌دهنده نهایی به عواملی چون تاخیر، تفکیک گویندگان، ابزارهای کنترلی، موقعیت جغرافیایی سرورها و هزینه‌ها وابسته خواهد بود.

چک‌لیست ارزیابی پیش از راه‌اندازی

ارزیابی عملیاتی پیش از استقرار نهایی باید شرایطی را پوشش دهد که امتیازهای کلی بنچمارک‌ها معمولاً پنهان می‌کنند:

  • دقت معنایی و نرخ WER برای تک‌تک زبان‌ها، لهجه‌ها و خطوط مورد نیاز
  • مکالمات چندزبانه با جابه‌جایی طبیعی میان زبان‌ها
  • میزان خطای شناسایی زبان در عبارت‌های کوتاه یا مبهم
  • عملکرد پرامپت کلمات کلیدی برای نام‌ها، اصطلاحات تجاری، سرنام‌ها و واژگان تخصصی به خط اصلی
  • کیفیت عملکرد تحت فشرده‌سازی، نویز محیطی، قطعی صدا و مکالمات پس‌زمینه
  • تاخیر تا اولین توکن و تاخیر کل در ترافیک‌های هم‌زمان بالا
  • دقت تفکیک گویندگان در مکالمات پربسامد و هم‌پوشانی صدای افراد
  • نحوه استانداردسازی تاریخ‌ها، اعداد، مبالغ ارزی و علائم نگارشی

در این اطلاعیه جزئیات قیمت‌گذاری مدل منتشر نشده است؛ بنابراین تعرفه‌ها، سهمیه‌ها، سیاست‌های نگهداری داده، مناطق پردازش و کنترل‌های امنیتی باید پیش از پیاده‌سازی نهایی، از طریق پنل کاربری و مستندات رسمی Sarvam بررسی شوند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر