پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ابزار جدید ABBYY پای فناوری قدیمی OCR را به خط لوله هوش مصنوعی باز کرد

انتشار:۳۱ شهریور ۱۴۰۵(۵ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

ابزار جدید FineParser با اجرای روی پردازنده‌های مرکزی (CPU) و در محیط کانتینر، ساختار و چیدمان دقیق اسناد را پیش از انتقال به مدل‌های زبانی بزرگ استخراج و حفظ می‌کند.

ابزار جدید ABBYY پای فناوری قدیمی OCR را به خط لوله هوش مصنوعی باز کرد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • شرکت ABBYY موتور تشخیص متن (OCR) خود را در قالب ابزار جدیدی به نام FineParser برای تغذیه سیستم‌های هوش مصنوعی عرضه کرد.
  • این ابزار بدون نیاز به پردازنده گرافیکی (GPU) در محیط Docker اجرا شده و چیدمان جداول و ساختار اسناد را به طور کامل حفظ می‌کند.
  • خروجی این سیستم در قالب‌های مختلفی از جمله فرمت فشرده DocLang ارائه می‌شود که به طور خاص برای پردازش در مدل‌های زبانی بزرگ طراحی شده است.

شرکت ABBYY موتور تشخیص اپتیکال کاراکتر (OCR) خود به نام FineReader را در قالب یک ابزار با قابلیت میزبانی شخصی (Self-hosted) عرضه کرده است. این ابزار وظیفه دارد اسناد را به متن‌های ساختاریافته‌ای تبدیل کند که توسط سیستم‌های هوش مصنوعی قابل استفاده باشند.

ابزار جدید این شرکت با نام FineParser در یک کانتینر Docker و صرفاً روی پردازنده‌های مرکزی (CPU) اجرا می‌شود و هیچ نیازی به پردازنده‌های گرافیکی (GPU) ندارد. هدف اصلی این ابزار، حفظ قالب و چیدمان سند در حین استخراج محتوای آن است.

این سیستم تصاویر اسناد در زبان‌های مختلف را دریافت کرده و آن‌ها را به متن‌های ساختاریافته و قالب‌بندی‌شده تبدیل می‌کند؛ به این ترتیب، پردازش این متون توسط سیستم‌های مدرنی مانند مدل‌های زبانی بزرگ (LLMs) در هوش مصنوعی مولد امکان‌پذیر می‌شود. البته این تنها کاربرد ابزار یادشده نیست؛ به گفته این شرکت، از FineParser می‌توان برای انتقال متون چاپی به سیستم‌های مدیریت محتوای (CMS) مدرن، آرشیو کردن اسناد یا به عنوان مرحله‌ای از یک خط لوله تولید محصول استفاده کرد.

شرکت ABBYY رویکرد FineParser را نوعی هوش مصنوعی «قطعی» (Deterministic) توصیف می‌کند. این سیستم به جای تولید نسخه‌ای تقریبی از اسناد، متن و ساختار دقیق آن‌ها را استخراج می‌کند. خروجی این ابزار سپس می‌تواند به سیستم‌های هوش مصنوعی مولد که پاسخ‌های غیرقابل پیش‌بینی‌تری دارند، منتقل شود.

این شرکت همچنین چارچوب برنامه‌نویسی یادگیری ماشین اختصاصی خود به نام NeoML را ارائه می‌دهد که کاملاً متن‌باز بوده و در GitHub در دسترس توسعه‌دهندگان قرار دارد. علاوه بر این، یک کیت توسعه نرم‌افزار (SDK) نیز منتشر شده است تا شرکت‌ها بتوانند موتور FineReader را در محصولات خود ادغام کنند.

با این حال، خود ابزار FineParser متن‌باز نیست، هرچند که ABBYY یک مخزن در GitHub برای ارائه مثال‌ها و پشتیبانی جامعه کاربری ایجاد کرده است. نسخه میزبانی شخصی این ابزار دارای یک طرح رایگان است که امکان پردازش ۱۰۰۰ صفحه در ماه را به مدت یک سال فراهم می‌کند. طبق اعلام ABBYY، طرح‌های اشتراکی برای اعتبارسنجی به یک سرور لایسنس متصل می‌شوند؛ بنابراین استقرار کاملاً آفلاین این سیستم نیازمند تهیه طرح سازمانی (Enterprise) است.

حفظ ساختار در این ابزار به معنای تشخیص ستون‌ها با رعایت ترتیب خواندن، تیترها و جداول (حتی جداول بدون حاشیه) است تا به جای ارائه مجموعه‌ای درهم‌ریخته از متون، خروجی مرتبی به دست آید. به گفته ABBYY، سیستم FineParser می‌تواند دست‌خط انسان و بیش از ۲۰۰ زبان مختلف را به راحتی پردازش کند.

توسعه‌دهندگان می‌توانند اسناد خود را از طریق رابط برنامه‌نویسی (REST API) به FineParser ارسال کرده و خروجی را در قالب‌های متن ساده، JSON یا DocLang (یک فرمت فشرده که به طور خاص برای ورودی مدل‌های زبانی بزرگ طراحی شده است) دریافت کنند.

ایده اصلی پشت FineParser این است که پیش از استفاده مدل‌های زبانی از یک سند، سیستم دیگری باید آن را به درستی بخواند. شرکت ABBYY روی این موضوع شرط‌بندی کرده است که رویکرد چند دهه‌ای آن در زمینه OCR، یعنی اجرا روی پردازنده مرکزی، حفظ چیدمان و واگذاری تولید متن به ابزارهای دیگر، همچنان جایگاه مهمی در خط لوله هوش مصنوعی دارد. گاهی اوقات، همان فناوری‌های قدیمی می‌توانند مفیدترین بخش یک سیستم مدرن باشند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر