پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

پروژه TypeLLM خروجی بدون خطای JSON در مدلهای زبانی را تضمین میکند

انتشار:۳ مهر ۱۴۰۵(۲ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

ابزار متن‌باز TypeLLM با اعمال محدودیت‌های مستقیم روی فرایند رمزگشایی در سطح توکن، تولید خروجی‌های منطبق بر استانداردهای JSON Schema را در مدل‌های زبانی تضمین می‌کند. این نوآوری با حذف خطاهای فرمت، نیاز نرم‌افزارها به اعتبارسنجی‌های پیچیده و ارسال درخواست‌های مجدد برای اصلاح داده‌ها را برطرف می‌سازد.

پروژه TypeLLM خروجی بدون خطای JSON در مدلهای زبانی را تضمین میکند

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تضمین تولید خروجی‌های ساختاریافته و منطبق بر JSON Schema در مدل‌های زبانی بدون خطاهای متداول فرمت
  • اعمال محدودیت بر فضای واژگان در سطح توکن طی هر گام از فرایند رمزگشایی (Decoding)
  • توسعه به صورت متن‌باز با مجوز Apache-2.0 با تلفیق سرور SGLang و کلاینت Python
  • حذف کامل سربار کدنویسی برای تجزیه، اصلاح و تلاش مجدد جهت بازیابی خروجی‌های معیوب در برنامه‌ها

ادغام JSON Schema در فرایند رمزگشایی مدل‌های زبانی با TypeLLM

ابزار TypeLLM با اعمال محدودیت بر فرایند انتخاب توکن‌ها، شرایطی را فراهم می‌کند تا مدل‌های زبانی (LLM) مقادیر منطقی (boolean)، اعداد، رشته‌های متنی و مقادیر شمارشی (enum) را دقیقاً منطبق با زیرمجموعه‌ای پشتیبانی‌شده از JSON Schema تولید کنند. این پروژه متن‌باز با مجوز Apache-2.0، یک سرور SGLang را با کلاینت Python ترکیب کرده و از امکان استدلال اختیاری پیش از ارائه پاسخ نهایی ساختاریافته پشتیبانی می‌کند.

تولید ساختارهای معیوب JSON، مقادیر نامعتبر enum و قالب‌های ناسازگار داده‌ها معمولاً توسعه‌دهندگان را ناچار می‌کند تا منطق پیچیده‌ای برای تجزیه (Parsing)، اصلاح خطا و ارسال درخواست‌های مجدد پیاده‌سازی کنند. در مقابل، ابزار TypeLLM ساختار داده‌های اعلام‌شده را در زمان تولید تضمین کرده و مقادیر خروجی Python را مستقیماً برای استفاده در کد برنامه بازمی‌گرداند. این تضمین بر ساختار داده‌ها و مقادیر مجاز حاکم است؛ هرچند صحت اطلاعات ارائه‌شده همچنان به ظرفیت مدل و نحوه پرامپت‌نویسی وابسته خواهد بود.

تبدیل نوع داده‌ها به قواعد رمزگشایی

توسعه‌دهندگان زمینه (Context) مشترک را تعریف کرده و فیلدهای مورد نیاز خود را مشخص می‌سازند. در هر مرحله از فرایند رمزگشایی، سرور فضای واژگان (Vocabulary) در دسترس را تنها به توکن‌هایی محدود می‌کند که می‌توانند مقداری معتبر بر اساس نوع داده اعلام‌شده ایجاد کنند.

نوع ساختار (Schema)
رفتار در زمان تولید
محدودیت‌های کنونی
string
تولید متن آزاد بر اساس محدودیت‌های تعریف‌شده رشته متنی.
از فیلد اختیاری maxLength پشتیبانی می‌کند.
integer
تولید دنباله‌ای مقید از توکن‌های نشان‌دهنده عدد صحیح.
ممکن است به تولید چندین توکن نیاز داشته باشد.
number
تولید دنباله‌ای مقید از توکن‌های نشان‌دهنده عدد.
ممکن است به تولید چندین توکن نیاز داشته باشد.
boolean
تعیین انتخاب نهایی تنها در قالب یک توکن واحد.
تنها یکی از دو مقدار مجاز را بازمی‌گرداند.
enum
تعیین انتخاب نهایی تنها در قالب یک توکن واحد.
تا حداکثر ۱۶ گزینه از انواع رشته یا عدد را می‌پذیرد.

فیلدهای boolean و enum امکان تولید گزینه‌های تعریف‌نشده را ندارند که این امر دسته‌ای کامل از خطاهای اعتبارسنجی را در سیستم‌های زیرین برطرف می‌کند. همچنین رشته‌های متنی باز و اعداد ضمن پیروی از قوانین نوع داده خود، انعطاف‌پذیری طول متغیر را حفظ می‌کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر