مدل هوش مصنوعی Sarvam Vision 2.1 رونمایی شد؛ رقابت با Gemini در درک اسناد و زبانهای هندی
استارتاپ Sarvam AI از مدل هوش مصنوعی Sarvam Vision 2.1 برای استخراج ساختاریافته اطلاعات، درک فرمها، جداول و خواندن دستخط در ۲۲ زبان رسمی هند رونمایی کرد. این مدل در بنچمارک اسناد olmOCR-Bench با کسب امتیاز ۸۷٫۳ از مدلهایی نظیر Gemini 3.6 Flash پیشی گرفته است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- رونمایی از مدل هوش مصنوعی Sarvam Vision 2.1 با قابلیت استخراج جداول، فرمها و متون دستنویس در ۲۲ زبان رسمی هند و زبان انگلیسی.
- کسب امتیاز ۸۷٫۳ در بنچمارک olmOCR-Bench و پیشی گرفتن از مدلهایی چون Gemini 3.6 Flash در ارزیابی اسناد ترکیبی.
- بهرهگیری از خط لوله بینایی سهمرحلهای (VLM) و بهینهسازی پسآموزش با روش یادگیری تقویتی با پاداشهای قابلتأیید (RLVR).
- ارائه از طریق رابطهای نرمافزاری و ایجنتهای پردازش متن برای دیجیتالیسازی یکپارچه آرشیوها و فرمهای اداری.
افزودن قابلیت استخراج دستخط، فرمها و جداول در Sarvam Vision 2.1
استارتاپ Sarvam AI از مدل هوش مصنوعی Sarvam Vision 2.1 رونمایی کرد؛ مدلی هوشمند برای تحلیل اسناد که از قابلیتهایی نظیر تشخیص اپتیکال نویسهها (OCR)، بازنویسی مبتنی بر درک چیدمان صفحه، استخراج دادههای فرمها، تجزیه جداول و خواندن دستخطهای هندی بهره میبرد. این شرکت از کسب امتیاز ۸۷٫۳ در بنچمارک olmOCR-Bench خبر داده و همزمان مجموعه داده Indic OCR Bench را نیز با پوشش ۲۲ زبان رسمی هند به همراه زبان انگلیسی منتشر کرده است.
در مقایسه با نسخه پیشین که در ماه فوریه منتشر شده بود، نسخه ۲٫۱ قابلیت استخراج ساختاریافته از جداول و فرمها را در کنار بازشناسی متون دستنویس هندی اضافه کرده است. Sarvam همچنین اعلام کرده که پشته استنتاج مدل را برای حجمهای کاری عملیاتی بهینهسازی کرده و هزینههای اعلامشده در زمان عرضه اولیه را کاهش داده است.
دسترسی به این مدل از طریق سه راهکار ارائه میشود:
- رابط کاربری Digitize API: اسناد چندصفحهای، جداول و محتواهای دستنویس را به متن ساختاریافته تبدیل میکند.
- رابط کاربری Extract API: جفتهای کلید-مقدار (Key-Value) و فیلدهای فرمها را استخراج میکند.
- ایجنتهای سند Akshar Document Agents: گردشهای کاری اسناد را همراه با امکان بررسی و نظارت انسانی ایجاد میکند.
مجموعه داده عمومی معرفیشده قابل دانلود است، در حالی که دسترسی به خود مدل از طریق سرویسهای میزبانیشده Sarvam امکانپذیر خواهد بود. با این حال، این شرکت در بیانیه رسمی خود جزئیات دقیقی پیرامون قیمتگذاری، میزان تاخیر (Latency)، توان عملیاتی، محدودیت نرخ درخواست یا ضمانتهای سطح خدمات (SLA) ارائه نکرده است.
کسب امتیاز ۸۷٫۳ در بنچمارک ترکیبی اسناد
بنچمارک olmOCR-Bench توانایی سیستمها را در خواندن انواع مختلف صفحات از جمله فرمولهای ریاضی مقالات arXiv، اسکنهای باکیفیت پایین و مخدوش، جداول، چیدمانهای چندستونی و فونتهای بسیار ریز مورد ارزیابی قرار میدهد. در آزمایشهای انجامشده توسط Sarvam، مدل Sarvam Vision 2.1 توانست امتیاز کلی ۸۷٫۳ را به دست آورد.
سیستم | امتیاز |
|---|---|
Sarvam Vision 2.1 | ۸۷٫۳ |
Infinity-Parser2 Pro | ۸۶٫۱ |
Opus 5 | ۸۵٫۱ |
Chandra-OCR2 | ۸۴٫۵ |
Mistral OCR4 | ۸۳٫۱ |
Gemini 3.6 Flash | ۸۲٫۴ |
Google Cloud Vision | ۳۹٫۶ |
AWS Textract | ۲۵٫۵ |
معیار OmniDocBench v1.6 وفاداری ساختاری مدل را از طریق فاصله ویرایش متن، معیار TEDS برای جداول و CDM برای فرمولها میسنجد. این شاخصها تطابق متن استخراجشده، ساختار جدول و فرمولهای ریاضی را با سند اصلی ارزیابی میکنند. در این ارزیابی، مدل Sarvam Vision 2.1 به امتیاز ۹۴٫۹۷ دست یافت و پس از PaddleOCR-VL 1.6 با امتیاز ۹۶٫۰۱ در جایگاه دوم قرار گرفت.
شرکت Sarvam جایگاه مدل خود را «بهینه پارتو» (Pareto optimal) توصیف کرده است، زیرا هیچیک از رقبای بررسیشده نتوانستهاند به طور همزمان در هر دو بنچمارک olmOCR-Bench و OmniDocBench امتیاز بالاتری از این مدل کسب کنند. البته صحت این نتیجهگیری تا حد زیادی به نسخههای مورد آزمایش رقبا، پرامپتها، پیشپردازشها و تنظیمات استنتاج در محیط تست Sarvam بستگی دارد.
ارزیابی ۶٬۹۰۹ نمونه در ۲۳ زبان
مجموعه داده Sarvam Indic OCR Bench شامل ۶٬۶۰۹ نمونه از ۲۲ زبان هندی و ۳۰۰ نمونه انگلیسی است. منابع این دیتاست شامل روزنامهها، بروشورها، کتب درسی و متون تاریخی نگارششده از سال ۱۸۰۰ میلادی تاکنون است که دگرگونی خطوط، تایپوگرافی، کیفیت چاپ و وضعیت سلامت اسناد را در بر میگیرد.
این بنچمارک میزان دقت بازشناسی حروف و کلمات را میسنجد و مواردی چون بازسازی چیدمان، تجزیه جداول، بازیابی فرمولها و استخراج کلید-مقدار را شامل نمیشود؛ بنابراین حوزه محدودتری را نسبت به دو بنچمارک جامع اسناد بررسی میکند.
سیستم | امتیاز |
|---|---|
Sarvam Vision 2.1 | ۸۷٫۳۹ |
Bodhan Indic-OCR | ۸۴٫۹۴ |
Gemini 3.6 Flash | ۷۹٫۳۵ |
Google Cloud Vision | ۷۱٫۷۶ |
نتایج عملکرد این مدل در سطح زبانهای مختلف تفاوتهای چشمگیری نشان میدهد. برای مثال Sarvam Vision 2.1 در زبان کونکانی امتیاز ۹۷٫۴۱ و در نپالی امتیاز ۹۷٫۰۰ را ثبت کرده، در حالی که در زبان کشمیری به امتیاز ۵۴٫۸۲ و در سانتالی به ۵۳٫۹۱ بسنده کرده است. این اختلاف ۴۳٫۵ امتیازی نشان میدهد که میانگین امتیاز کلی، معیار دقیقی برای سنجش عملکرد مدل در تکتک زبانها یا خطوط نوشتاری نیست.
خط لوله بینایی سهمرحلهای
توسعهدهندگان معماری این مدل را یک سیستم «VLM مبتنی بر مهارکننده» (harness-with-VLM) توصیف میکنند. در این ساختار، یک مدل بینایی-زبانی (VLM) تصاویر اسناد را بررسی کرده و متن را تولید میکند، در حالی که ماژولهای جانبی وظیفه تقسیمبندی صفحه و تعیین توالی صحیح خوانش را بر عهده دارند.
- تجزیه چیدمان (Layout parsing): یک تجزیهکننده معنایی بخشهای مختلف صفحه را شناسایی میکند.
- ترتیب خوانش (Reading order): یک شبکه اشارهگر توالی پردازش بخشهای شناساییشده را تعیین میکند.
- رونویسی (Transcription): مدل VLM بخشهای برشخورده را میخواند و متن خروجی را تولید میکند.
مرحله آموزش مدل با ترکیب دادههای واقعی گزینششده و نمونههای داده مصنوعی برای استخراج مقادیر کلیدی و دستخطهای هندی انجام شده است. Sarvam فرمهای چاپی و دستنویسی را در چندین زبان تولید کرده و سپس از فرمهای واقعی گردآوریشده از وب به عنوان الگو برای تنوعبخشی به دادههای مصنوعی بهره برده است.
در فاز پسآموزش، از تنظیم دقیق نظارتشده (Supervised Fine-Tuning) و یادگیری تقویتی با پاداشهای قابلتأیید (RLVR) استفاده شده است. تنظیم دقیق با نظارت، خروجیهای هدف را از روی نمونههای برچسبگذاریشده آموزش میدهد و روش RLVR به پاسخهایی که بتوان صحت آنها را به طور خودکار با دادههای مرجع ارزیابی کرد، پاداش اختصاص میدهد.
با این وجود، جزئیات فنی منتشرشده اطلاعاتی درباره مدل پایه VLM، تعداد پارامترها، ابعاد مجموعه دادههای آموزشی، محدودیتهای ورودی یا امکان دانلود وزنهای مدل ارائه نمیدهد. عدم شفافسازی در این بخشها، امکان مقایسه دقیق معماری و بازتولید مستقل نتایج توسط پژوهشگران را محدود میسازد.
هدف اصلی؛ صفهای پردازشی با زبانهای ترکیبی
صفهای اسناد با ترکیب زبانهای انگلیسی و هندی مهمترین جامعه هدف این مدل هستند، زیرا یک بستر نرمافزاری واحد میتواند پردازش OCR، جداول، فرمها و دستخط را به طور یکپارچه انجام دهد. از جمله سناریوهای کاربردی این سیستم میتوان به موارد زیر اشاره کرد:
- دیجیتالیسازی اسناد آرشیوی تاریخی هند و اسکنهای فرسوده
- استخراج فیلدهای اطلاعاتی از فرمها و درخواستهای دستنویس دولتی
- تجزیه جداول چندصفحهای در گزارشهای مالی و کتابهای درسی
- پردازش اسناد دوزبانه انگلیسی و هندی بدون نیاز به ارجاع هر زبان به یک سرویس OCR جداگانه
برای ارزیابی کارایی در محیطهای عملیاتی، سازمانها باید اسناد نمونه متناسب با هر زبان، خط نوشتاری، چیدمان صفحه و کیفیت اسکن را تست کنند. علاوه بر این، تیمهای فنی ملزم به بررسی الگوهای استخراج، سازوکارهای مدیریت خطا، تاخیر، توان عملیاتی، نیاز به بازبینی انسانی و مجموع هزینهها هستند؛ چرا که بنچمارکهای منتشرشده به این ابهامات عملیاتی پاسخی نمیدهند.
مدل Sarvam Vision 2.1 عملکردی رقابتی را در درک اسناد عمومی با پوشش گستردهتری از زبانهای هندی (فراتر از آنچه سرویسهای مرسوم انگلیسیمحور ارائه میدهند) ادغام کرده است. با این حال، آزمایشهای مستقل در محیطهای کاری واقعی مشخص خواهند کرد که آیا این ادغام میتواند خط لولههای پیچیده پردازش اسناد را سادهتر کند یا خیر.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.