پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل هوش مصنوعی Sarvam Vision 2.1 رونمایی شد؛ رقابت با Gemini در درک اسناد و زبان‌های هندی

انتشار:۲ مهر ۱۴۰۵(۳ روز پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Sarvam AI از مدل هوش مصنوعی Sarvam Vision 2.1 برای استخراج ساختاریافته اطلاعات، درک فرم‌ها، جداول و خواندن دستخط در ۲۲ زبان رسمی هند رونمایی کرد. این مدل در بنچمارک اسناد olmOCR-Bench با کسب امتیاز ۸۷٫۳ از مدلهایی نظیر Gemini 3.6 Flash پیشی گرفته است.

مدل هوش مصنوعی Sarvam Vision 2.1 رونمایی شد؛ رقابت با Gemini در درک اسناد و زبان‌های هندی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • رونمایی از مدل هوش مصنوعی Sarvam Vision 2.1 با قابلیت استخراج جداول، فرم‌ها و متون دست‌نویس در ۲۲ زبان رسمی هند و زبان انگلیسی.
  • کسب امتیاز ۸۷٫۳ در بنچمارک olmOCR-Bench و پیشی گرفتن از مدلهایی چون Gemini 3.6 Flash در ارزیابی اسناد ترکیبی.
  • بهره‌گیری از خط لوله بینایی سه‌مرحله‌ای (VLM) و بهینه‌سازی پس‌آموزش با روش یادگیری تقویتی با پاداش‌های قابل‌تأیید (RLVR).
  • ارائه از طریق رابط‌های نرم‌افزاری و ایجنت‌های پردازش متن برای دیجیتالی‌سازی یکپارچه آرشیوها و فرم‌های اداری.

افزودن قابلیت استخراج دستخط، فرم‌ها و جداول در Sarvam Vision 2.1

استارتاپ Sarvam AI از مدل هوش مصنوعی Sarvam Vision 2.1 رونمایی کرد؛ مدلی هوشمند برای تحلیل اسناد که از قابلیت‌هایی نظیر تشخیص اپتیکال نویسه‌ها (OCR)، بازنویسی مبتنی بر درک چیدمان صفحه، استخراج داده‌های فرم‌ها، تجزیه جداول و خواندن دستخط‌های هندی بهره می‌برد. این شرکت از کسب امتیاز ۸۷٫۳ در بنچمارک olmOCR-Bench خبر داده و هم‌زمان مجموعه داده Indic OCR Bench را نیز با پوشش ۲۲ زبان رسمی هند به همراه زبان انگلیسی منتشر کرده است.

در مقایسه با نسخه پیشین که در ماه فوریه منتشر شده بود، نسخه ۲٫۱ قابلیت استخراج ساختاریافته از جداول و فرم‌ها را در کنار بازشناسی متون دست‌نویس هندی اضافه کرده است. Sarvam همچنین اعلام کرده که پشته استنتاج مدل را برای حجم‌های کاری عملیاتی بهینه‌سازی کرده و هزینه‌های اعلام‌شده در زمان عرضه اولیه را کاهش داده است.

دسترسی به این مدل از طریق سه راهکار ارائه می‌شود:

  • رابط کاربری Digitize API: اسناد چندصفحه‌ای، جداول و محتواهای دست‌نویس را به متن ساختاریافته تبدیل می‌کند.
  • رابط کاربری Extract API: جفت‌های کلید-مقدار (Key-Value) و فیلدهای فرم‌ها را استخراج می‌کند.
  • ایجنت‌های سند Akshar Document Agents: گردش‌های کاری اسناد را همراه با امکان بررسی و نظارت انسانی ایجاد می‌کند.

مجموعه داده عمومی معرفی‌شده قابل دانلود است، در حالی که دسترسی به خود مدل از طریق سرویس‌های میزبانی‌شده Sarvam امکان‌پذیر خواهد بود. با این حال، این شرکت در بیانیه رسمی خود جزئیات دقیقی پیرامون قیمت‌گذاری، میزان تاخیر (Latency)، توان عملیاتی، محدودیت نرخ درخواست یا ضمانت‌های سطح خدمات (SLA) ارائه نکرده است.

کسب امتیاز ۸۷٫۳ در بنچمارک ترکیبی اسناد

بنچمارک olmOCR-Bench توانایی سیستم‌ها را در خواندن انواع مختلف صفحات از جمله فرمول‌های ریاضی مقالات arXiv، اسکن‌های باکیفیت پایین و مخدوش، جداول، چیدمان‌های چندستونی و فونت‌های بسیار ریز مورد ارزیابی قرار می‌دهد. در آزمایش‌های انجام‌شده توسط Sarvam، مدل Sarvam Vision 2.1 توانست امتیاز کلی ۸۷٫۳ را به دست آورد.

سیستم
امتیاز
Sarvam Vision 2.1
۸۷٫۳
Infinity-Parser2 Pro
۸۶٫۱
Opus 5
۸۵٫۱
Chandra-OCR2
۸۴٫۵
Mistral OCR4
۸۳٫۱
Gemini 3.6 Flash
۸۲٫۴
Google Cloud Vision
۳۹٫۶
AWS Textract
۲۵٫۵

معیار OmniDocBench v1.6 وفاداری ساختاری مدل را از طریق فاصله ویرایش متن، معیار TEDS برای جداول و CDM برای فرمول‌ها می‌سنجد. این شاخص‌ها تطابق متن استخراج‌شده، ساختار جدول و فرمول‌های ریاضی را با سند اصلی ارزیابی می‌کنند. در این ارزیابی، مدل Sarvam Vision 2.1 به امتیاز ۹۴٫۹۷ دست یافت و پس از PaddleOCR-VL 1.6 با امتیاز ۹۶٫۰۱ در جایگاه دوم قرار گرفت.

شرکت Sarvam جایگاه مدل خود را «بهینه پارتو» (Pareto optimal) توصیف کرده است، زیرا هیچ‌یک از رقبای بررسی‌شده نتوانسته‌اند به طور هم‌زمان در هر دو بنچمارک olmOCR-Bench و OmniDocBench امتیاز بالاتری از این مدل کسب کنند. البته صحت این نتیجه‌گیری تا حد زیادی به نسخه‌های مورد آزمایش رقبا، پرامپت‌ها، پیش‌پردازش‌ها و تنظیمات استنتاج در محیط تست Sarvam بستگی دارد.

ارزیابی ۶٬۹۰۹ نمونه در ۲۳ زبان

مجموعه داده Sarvam Indic OCR Bench شامل ۶٬۶۰۹ نمونه از ۲۲ زبان هندی و ۳۰۰ نمونه انگلیسی است. منابع این دیتاست شامل روزنامه‌ها، بروشورها، کتب درسی و متون تاریخی نگارش‌شده از سال ۱۸۰۰ میلادی تاکنون است که دگرگونی خطوط، تایپوگرافی، کیفیت چاپ و وضعیت سلامت اسناد را در بر می‌گیرد.

این بنچمارک میزان دقت بازشناسی حروف و کلمات را می‌سنجد و مواردی چون بازسازی چیدمان، تجزیه جداول، بازیابی فرمول‌ها و استخراج کلید-مقدار را شامل نمی‌شود؛ بنابراین حوزه محدودتری را نسبت به دو بنچمارک جامع اسناد بررسی می‌کند.

سیستم
امتیاز
Sarvam Vision 2.1
۸۷٫۳۹
Bodhan Indic-OCR
۸۴٫۹۴
Gemini 3.6 Flash
۷۹٫۳۵
Google Cloud Vision
۷۱٫۷۶

نتایج عملکرد این مدل در سطح زبان‌های مختلف تفاوت‌های چشمگیری نشان می‌دهد. برای مثال Sarvam Vision 2.1 در زبان کونکانی امتیاز ۹۷٫۴۱ و در نپالی امتیاز ۹۷٫۰۰ را ثبت کرده، در حالی که در زبان کشمیری به امتیاز ۵۴٫۸۲ و در سانتالی به ۵۳٫۹۱ بسنده کرده است. این اختلاف ۴۳٫۵ امتیازی نشان می‌دهد که میانگین امتیاز کلی، معیار دقیقی برای سنجش عملکرد مدل در تک‌تک زبان‌ها یا خطوط نوشتاری نیست.

خط لوله بینایی سه‌مرحله‌ای

توسعه‌دهندگان معماری این مدل را یک سیستم «VLM مبتنی بر مهارکننده» (harness-with-VLM) توصیف می‌کنند. در این ساختار، یک مدل بینایی-زبانی (VLM) تصاویر اسناد را بررسی کرده و متن را تولید می‌کند، در حالی که ماژول‌های جانبی وظیفه تقسیم‌بندی صفحه و تعیین توالی صحیح خوانش را بر عهده دارند.

  1. تجزیه چیدمان (Layout parsing): یک تجزیه‌کننده معنایی بخش‌های مختلف صفحه را شناسایی می‌کند.
  2. ترتیب خوانش (Reading order): یک شبکه اشاره‌گر توالی پردازش بخش‌های شناسایی‌شده را تعیین می‌کند.
  3. رونویسی (Transcription): مدل VLM بخش‌های برش‌خورده را می‌خواند و متن خروجی را تولید می‌کند.

مرحله آموزش مدل با ترکیب داده‌های واقعی گزینش‌شده و نمونه‌های داده مصنوعی برای استخراج مقادیر کلیدی و دستخط‌های هندی انجام شده است. Sarvam فرم‌های چاپی و دست‌نویسی را در چندین زبان تولید کرده و سپس از فرم‌های واقعی گردآوری‌شده از وب به عنوان الگو برای تنوع‌بخشی به داده‌های مصنوعی بهره برده است.

در فاز پس‌آموزش، از تنظیم دقیق نظارت‌شده (Supervised Fine-Tuning) و یادگیری تقویتی با پاداش‌های قابل‌تأیید (RLVR) استفاده شده است. تنظیم دقیق با نظارت، خروجی‌های هدف را از روی نمونه‌های برچسب‌گذاری‌شده آموزش می‌دهد و روش RLVR به پاسخ‌هایی که بتوان صحت آن‌ها را به طور خودکار با داده‌های مرجع ارزیابی کرد، پاداش اختصاص می‌دهد.

با این وجود، جزئیات فنی منتشرشده اطلاعاتی درباره مدل پایه VLM، تعداد پارامترها، ابعاد مجموعه داده‌های آموزشی، محدودیت‌های ورودی یا امکان دانلود وزن‌های مدل ارائه نمی‌دهد. عدم شفاف‌سازی در این بخش‌ها، امکان مقایسه دقیق معماری و بازتولید مستقل نتایج توسط پژوهشگران را محدود می‌سازد.

هدف اصلی؛ صف‌های پردازشی با زبان‌های ترکیبی

صف‌های اسناد با ترکیب زبان‌های انگلیسی و هندی مهم‌ترین جامعه هدف این مدل هستند، زیرا یک بستر نرم‌افزاری واحد می‌تواند پردازش OCR، جداول، فرم‌ها و دستخط را به طور یکپارچه انجام دهد. از جمله سناریوهای کاربردی این سیستم می‌توان به موارد زیر اشاره کرد:

  • دیجیتالی‌سازی اسناد آرشیوی تاریخی هند و اسکن‌های فرسوده
  • استخراج فیلدهای اطلاعاتی از فرم‌ها و درخواست‌های دست‌نویس دولتی
  • تجزیه جداول چندصفحه‌ای در گزارش‌های مالی و کتاب‌های درسی
  • پردازش اسناد دوزبانه انگلیسی و هندی بدون نیاز به ارجاع هر زبان به یک سرویس OCR جداگانه

برای ارزیابی کارایی در محیط‌های عملیاتی، سازمان‌ها باید اسناد نمونه متناسب با هر زبان، خط نوشتاری، چیدمان صفحه و کیفیت اسکن را تست کنند. علاوه بر این، تیم‌های فنی ملزم به بررسی الگوهای استخراج، سازوکارهای مدیریت خطا، تاخیر، توان عملیاتی، نیاز به بازبینی انسانی و مجموع هزینه‌ها هستند؛ چرا که بنچمارک‌های منتشرشده به این ابهامات عملیاتی پاسخی نمی‌دهند.

مدل Sarvam Vision 2.1 عملکردی رقابتی را در درک اسناد عمومی با پوشش گسترده‌تری از زبان‌های هندی (فراتر از آنچه سرویس‌های مرسوم انگلیسی‌محور ارائه می‌دهند) ادغام کرده است. با این حال، آزمایش‌های مستقل در محیط‌های کاری واقعی مشخص خواهند کرد که آیا این ادغام می‌تواند خط لوله‌های پیچیده پردازش اسناد را ساده‌تر کند یا خیر.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر