پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل متن‌باز TeleOCR با ۱٫۲ میلیارد پارامتر Gemini 3 Pro را در تحلیل اسناد شکست داد

انتشار:۴ مهر ۱۴۰۵(۲ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

مجموعه StarDoc-AI از مدل متن‌باز TeleOCR رونمایی کرد؛ یک مدل بینایی-زبانی ۱٫۲ میلیارد پارامتری که با پردازش یکپارچه انواع اسناد و تصاویر دفرمه، رقبای غول‌پیکری همچون Gemini 3 Pro را در بنچمارک‌های تحلیلی پشت سر گذاشته است.

مدل متن‌باز TeleOCR با ۱٫۲ میلیارد پارامتر Gemini 3 Pro را در تحلیل اسناد شکست داد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل بینایی-زبانی متن‌باز TeleOCR با ۱٫۲ میلیارد پارامتر و بر پایه Qwen2.5-VL تحت مجوز Apache-2.0 عرضه شد.
  • این مدل اسناد دیجیتال PDF، فایل‌های اسکن‌شده و تصاویر زاویه‌دار ثبت‌شده با دوربین را در یک چک‌پوینت واحد پردازش می‌کند.
  • در بنچمارک جامع OmniDocBench v1.6، مدل TeleOCR با کسب امتیاز ۹۶٫۸۷ موفق شد مدل‌های پرچمداری نظیر Gemini 3 Pro و GPT-5.2 را شکست دهد.

پردازش هم‌زمان اسناد دیجیتال و تصاویر تغییرشکل‌یافته با یک مدل ۱٫۲ میلیارد پارامتری

مجموعه StarDoc-AI شناسنامه مدل (Model Card) مربوط به TeleOCR را منتشر کرد؛ یک مدل بینایی-زبانی با حدود ۱٫۲ میلیارد پارامتر که به‌طور اختصاصی برای تجزیه و تحلیل اسناد (Document Parsing) طراحی شده است. این مدل که بر پایه Qwen2.5-VL توسعه یافته و تحت مجوز متن‌باز Apache-2.0 عرضه شده است، می‌تواند فایل‌های دیجیتالی اولیه، صفحات اسکن‌شده و تصاویر ثبت‌شده با دوربین را تنها در قالب یک چک‌پوینت واحد پردازش کند. این معماری یکپارچه نیاز به به‌کارگیری چندین مدل مجزا برای خواندن صفحات دارای اعوجاج، جدول‌ها، فرمول‌ها و چیدمان‌های پیچیده را به حداقل می‌رساند.

در پایپ‌لاین‌های سنتی پردازش اسناد عکس‌برداری‌شده، معمولاً مراحلی چون اصلاح پرسپکتیو، تشخیص ساختار و چیدمان صفحه، اجرای شناسایی نوری کاراکترها (OCR) و در نهایت استفاده از ابزارهای تفکیک‌شده برای تحلیل جدول یا فرمول به اجرا درمی‌آید. با این حال، TeleOCR محتوا و هندسه صفحه را به‌صورت مستقیم از تصویر ورودی استخراج می‌کند و قادر است چندضلعی‌های موقعیت‌یابی چندنقطه‌ای را برای دنبال‌کردن خطوط منحنی یا زاویه‌دار رسم نماید. در خروجی این مدل، جدول‌ها در قالب زبان ساختار جدول باز (OTSL) مرتب‌سازی می‌شوند و فرمول‌های ریاضی نیز با فرمت استاندارد LaTeX ارائه می‌گردند.

ثبت امتیازات چشمگیر با وجود حجم ۱٫۲ میلیارد پارامتری

توسعه‌دهندگان این پروژه از دستیابی به برترین رتبه‌ها در سه مجموعه ارزیابی و بنچمارک معتبر تحلیل اسناد، به‌ویژه آزمون‌های مبتنی بر تصاویر بی‌کیفیت و عکس‌های دارای اعوجاج، خبر داده‌اند. تمامی امتیازات زیر بر پایه مقیاس ۱۰۰ امتیازی پروژه محاسبه شده‌اند که در آن نمرات بالاتر به منزله عملکرد دقیق‌تر و کارآمدتر است.

بنچمارک
TeleOCR
مقایسه گزارش‌شده
محور ارزیابی
OmniDocBench v1.6
امتیاز کلی ۹۶٫۸۷
مدل Gemini 3 Pro با ۹۲٫۸۵مدل Qwen3-VL-235B با ۸۹٫۷۸مدل GPT-5.2 با ۸۶٫۵۲
متن، چیدمان، جدول‌ها و فرمول‌ها در اسناد متنوع
بخش جدول‌های OmniDocBench
شاخص TEDS با ۹۷٫۰۵شاخص TEDS-S با ۹۸٫۵۲
کسب رتبه نخست بر اساس گزارش‌ها
صحت محتوا و وفاداری ساختاری جدول‌ها
Wild OmniDocBench
امتیاز کلی ۸۸٫۵۳
بالاترین امتیاز گزارش‌شده
صفحات عکس‌برداری‌شده در شرایط واقعی محیطی
PureDocBench (نسخه تخریب‌شده واقعی)
۷۰٫۸۵
مدل MinerU2.5-Pro با ۶۲٫۵۶
تصاویر تار و تخریب‌شده اسناد

جدول رده‌بندی بنچمارک OmniDocBench نشان می‌دهد که TeleOCR از مدل‌های تخصصی دیگری چون OvisOCR2، PaddleOCR-VL-1.6 و MinerU2.5-Pro نیز پیشی گرفته است. شاخص TEDS به شباهت بر پایه فاصله ویرایش درختی اشاره دارد که ساختار و داده‌های جدول‌های پیش‌بینی‌شده را با جدول‌های مرجع مقایسه می‌کند؛ در حالی که زیرشاخص TEDS-S تمرکز خود را منحصراً بر دقت ساختار هندسی و چیدمان قرار می‌دهد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر