مدل متنباز TeleOCR با ۱٫۲ میلیارد پارامتر Gemini 3 Pro را در تحلیل اسناد شکست داد
مجموعه StarDoc-AI از مدل متنباز TeleOCR رونمایی کرد؛ یک مدل بینایی-زبانی ۱٫۲ میلیارد پارامتری که با پردازش یکپارچه انواع اسناد و تصاویر دفرمه، رقبای غولپیکری همچون Gemini 3 Pro را در بنچمارکهای تحلیلی پشت سر گذاشته است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل بینایی-زبانی متنباز TeleOCR با ۱٫۲ میلیارد پارامتر و بر پایه Qwen2.5-VL تحت مجوز Apache-2.0 عرضه شد.
- این مدل اسناد دیجیتال PDF، فایلهای اسکنشده و تصاویر زاویهدار ثبتشده با دوربین را در یک چکپوینت واحد پردازش میکند.
- در بنچمارک جامع OmniDocBench v1.6، مدل TeleOCR با کسب امتیاز ۹۶٫۸۷ موفق شد مدلهای پرچمداری نظیر Gemini 3 Pro و GPT-5.2 را شکست دهد.
پردازش همزمان اسناد دیجیتال و تصاویر تغییرشکلیافته با یک مدل ۱٫۲ میلیارد پارامتری
مجموعه StarDoc-AI شناسنامه مدل (Model Card) مربوط به TeleOCR را منتشر کرد؛ یک مدل بینایی-زبانی با حدود ۱٫۲ میلیارد پارامتر که بهطور اختصاصی برای تجزیه و تحلیل اسناد (Document Parsing) طراحی شده است. این مدل که بر پایه Qwen2.5-VL توسعه یافته و تحت مجوز متنباز Apache-2.0 عرضه شده است، میتواند فایلهای دیجیتالی اولیه، صفحات اسکنشده و تصاویر ثبتشده با دوربین را تنها در قالب یک چکپوینت واحد پردازش کند. این معماری یکپارچه نیاز به بهکارگیری چندین مدل مجزا برای خواندن صفحات دارای اعوجاج، جدولها، فرمولها و چیدمانهای پیچیده را به حداقل میرساند.
در پایپلاینهای سنتی پردازش اسناد عکسبرداریشده، معمولاً مراحلی چون اصلاح پرسپکتیو، تشخیص ساختار و چیدمان صفحه، اجرای شناسایی نوری کاراکترها (OCR) و در نهایت استفاده از ابزارهای تفکیکشده برای تحلیل جدول یا فرمول به اجرا درمیآید. با این حال، TeleOCR محتوا و هندسه صفحه را بهصورت مستقیم از تصویر ورودی استخراج میکند و قادر است چندضلعیهای موقعیتیابی چندنقطهای را برای دنبالکردن خطوط منحنی یا زاویهدار رسم نماید. در خروجی این مدل، جدولها در قالب زبان ساختار جدول باز (OTSL) مرتبسازی میشوند و فرمولهای ریاضی نیز با فرمت استاندارد LaTeX ارائه میگردند.
ثبت امتیازات چشمگیر با وجود حجم ۱٫۲ میلیارد پارامتری
توسعهدهندگان این پروژه از دستیابی به برترین رتبهها در سه مجموعه ارزیابی و بنچمارک معتبر تحلیل اسناد، بهویژه آزمونهای مبتنی بر تصاویر بیکیفیت و عکسهای دارای اعوجاج، خبر دادهاند. تمامی امتیازات زیر بر پایه مقیاس ۱۰۰ امتیازی پروژه محاسبه شدهاند که در آن نمرات بالاتر به منزله عملکرد دقیقتر و کارآمدتر است.
بنچمارک | TeleOCR | مقایسه گزارششده | محور ارزیابی |
|---|---|---|---|
OmniDocBench v1.6 | امتیاز کلی ۹۶٫۸۷ | مدل Gemini 3 Pro با ۹۲٫۸۵مدل Qwen3-VL-235B با ۸۹٫۷۸مدل GPT-5.2 با ۸۶٫۵۲ | متن، چیدمان، جدولها و فرمولها در اسناد متنوع |
بخش جدولهای OmniDocBench | شاخص TEDS با ۹۷٫۰۵شاخص TEDS-S با ۹۸٫۵۲ | کسب رتبه نخست بر اساس گزارشها | صحت محتوا و وفاداری ساختاری جدولها |
Wild OmniDocBench | امتیاز کلی ۸۸٫۵۳ | بالاترین امتیاز گزارششده | صفحات عکسبرداریشده در شرایط واقعی محیطی |
PureDocBench (نسخه تخریبشده واقعی) | ۷۰٫۸۵ | مدل MinerU2.5-Pro با ۶۲٫۵۶ | تصاویر تار و تخریبشده اسناد |
جدول ردهبندی بنچمارک OmniDocBench نشان میدهد که TeleOCR از مدلهای تخصصی دیگری چون OvisOCR2، PaddleOCR-VL-1.6 و MinerU2.5-Pro نیز پیشی گرفته است. شاخص TEDS به شباهت بر پایه فاصله ویرایش درختی اشاره دارد که ساختار و دادههای جدولهای پیشبینیشده را با جدولهای مرجع مقایسه میکند؛ در حالی که زیرشاخص TEDS-S تمرکز خود را منحصراً بر دقت ساختار هندسی و چیدمان قرار میدهد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.