پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار جدید Unsloth: تبدیل مدل جمع‌وجور ۰.۸ میلیاردی به موتور تصمیم‌گیری فوق‌سریع با دقت ۷۸ درصدی!

انتشار:۱۵ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

تیم Unsloth قابلیت جدیدی برای فاین‌تیون مدل‌های زبانی معرفی کرده که به جای تولید متن‌های طولانی، مستقیماً تصمیمات ساختاریافته و احتمالات دقیق را خروجی می‌دهد. با این نوآوری، حتی یک مدل کوچک ۰.۸ میلیارد پارامتری مثل Qwen3.5 می‌تواند بدون خطاهای رایج JSON، با دقت خیره‌کننده ۷۸ درصد و مصرف تنها ۴ گیگابایت حافظه گرافیکی، وظایف طبقه‌بندی و تصمیم‌گیری سازمانی را به سرعت انجام دهد.

شاهکار جدید Unsloth: تبدیل مدل جمع‌وجور ۰.۸ میلیاردی به موتور تصمیم‌گیری فوق‌سریع با دقت ۷۸ درصدی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم محبوب Unsloth قابلیتی به ابزار‌های خود اضافه کرده که مدل‌های زبانی را برای تصمیم‌گیری سریع و خروجی‌های ساختاریافته (مثل بله/خیر، امتیازدهی و برچسب‌گذاری) بدون معطلیِ تولید متن معمولی، فاین‌تیون می‌کند.
  • در آزمایش‌های انجام‌شده، مدل بندانگشتی Qwen3.5 با تنها ۰.۸ میلیارد پارامتر توانست به دقت خیره‌کننده ۷۸ درصدی برسد و در بنچمارک‌های مختلف جهش عظیمی ثبت کند؛ آن هم تنها با مصرف ۴ گیگابایت VRAM در ۴۲ دقیقه!
  • این روش با دور زدن فرآیند خسته‌کننده تولید توکن‌به‌توکن، مشکلاتی مثل شکستن ساختار JSON و تاخیر خروجی را کاملاً حل کرده و گزینه‌ای فوق‌العاده به‌صرفه برای جایگزینی APIهای گران‌قیمت در پردازش تیکت‌ها و فرم‌هاست.

آموزش مدل‌های زبانی کوچک برای تصمیم‌گیری ساختاریافته در Unsloth

تیم Unsloth قابلیت جدیدی برای فاین‌تیون مدل‌های تصمیم‌گیری (Decision Models) به اپلیکیشن دسکتاپ و ابزار‌های متن‌باز خود اضافه کرده است؛ جزئیات کامل این روش در راهنمای مدل تصمیم‌گیری این مجموعه تشریح شده است. توسعه‌دهندگان حالا می‌توانند به سادگی یک مدل زبانی از پیش‌آموزش‌دیده را طوری آموزش دهند که برچسب‌ها را انتخاب کند، به سوالات بله یا خیر پاسخ دهد یا در یک مقیاس مشخص امتیاز بدهد؛ آن هم در حالی که برای تک‌تک گزینه‌ها احتمال دقیق ریاضی محاسبه می‌شود. در این روش استنتاج، داده‌های ساختاریافته مستقیماً و بدون نیاز به تولید گام‌به‌گام متن (تولید خودبازگشتی) تحویل داده می‌شوند؛ اتفاقی که تأخیر پاسخ‌دهی را به شدت کاهش داده و کابوس همیشگی خطاهای خروجی و خراب شدن فرمت JSON را برای همیشه از بین می‌برد.

پرواز دقت مدل ۰.۸ میلیاردی به بالای ۷۰ درصد!

بر اساس نتایج بنچمارک‌های منتشرشده، این نوع فاین‌تیون جهش چشمگیری در دقت مدل کوچک Qwen3.5-0.8B روی سه دیتاست مختلف دسته‌بندی ایجاد کرده است:

مجموعه داده
قبل از آموزش
بعد از آموزش
میزان بهبود
typed-decisions
۳۶٪
۷۳٪
۳۷ واحد درصد
BANKING77
۷٪
۷۴٪
۶۷ واحد درصد
CLINC150
۱۹٪
۷۶٪
۵۷ واحد درصد

در یک ارزیابی جداگانه روی ۳۰۰۰ ردیف داده تست دست‌نخورده، این مدل به دقت تحسین‌برانگیز ۷۸ درصدی رسید؛ جالب‌تر این که کل فرایند آموزش این مدل ۰.۸ میلیاردی تنها به ۴ گیگابایت حافظه گرافیکی (VRAM) نیاز داشت. البته این نتایج حاصل ترکیب داده‌ها و تنظیمات اختصاصی گزارش‌شده توسط تیم سازنده است. برای استفاده در محیط‌های عملیاتی و واقعی، مهندسان باید دقت هر کلاس، هزینه‌های ناشی از خطای مثبت کاذب، میزان کالیبراسیون، تأخیر و عملکرد مدل روی داده‌های واقعی محیط کاری خود را نیز به دقت ارزیابی کنند.

یک پردازش واحد، چندین پاسخ ساختاریافته

هنگام اجرای مدل در فاز استنتاج، کاربر متن ورودی را همراه با یک یا چند پرسش مشخص و گزینه‌های مجاز به مدل تحویل می‌دهد. بدنه اصلی مدل زبانی کل این پرامپت را تنها در یک مرحله کدگذاری و پردازش می‌کند. سپس یک سر طبقه‌بندی (Classification Head) سبک و جمع‌وجور بر پایه معماری Clef از شرکت Cloudflare، گزینه‌های مختلف را بر اساس لایه‌های میانی مدل امتیازدهی کرده و توزیع احتمال دقیق هر پرسش را برمی‌گرداند.

در مدل‌های عادی، تولید توکن‌به‌توکن و خودبازگشتی بسیار زمان‌بر است و معمولاً به یک پارسر اضافه برای بررسی سلامت خروجی نیاز دارد. اما مسیر تصمیم‌گیری Unsloth این چرخه وقت‌گیر را کاملاً دور می‌زند؛ به این ترتیب هم تأخیر ناشی از ساخت توکن‌ها ناپدید می‌شود و هم دیگر خبری از خطاهای ساختاری در خروجی نیست. با این حال توجه داشته باشید که بدنه اصلی مدل همچنان کل متن پرامپت را می‌خواند؛ بنابراین هر چقدر سوالات و گزینه‌های بیشتری اضافه کنید، طول توالی و حجم محاسبات بالا‌تر خواهد رفت.

برای نمونه، متن یک تیکت پشتیبانی مشتریان می‌تواند تنها با یک بار عبور از شبکه، همزمان چندین تصمیم مهم را رقم بزند: هدایت تیکت به تیم مربوطه، تشخیص قصد کاربر و مشخص شدن این که آیا مشتری درخواست بازگشت وجه دارد یا خیر. هر فیلد به طور کاملاً مجزا مقدار برگزیده و درصد احتمال خاص خودش را دریافت می‌کند.

خروجی ای‌پی‌آی تصمیم‌گیری به همراه امتیاز احتمال برای بخش‌های مالی، حساب کاربری، فروش و پشتیبانی فنی
ای‌پی‌آی تصمیم‌گیری دسته‌بندی‌ها و نمرات احتمال را در قالب داده‌های ساختاریافته و منظم تحویل می‌دهد.

فرمول جادویی پشت این جهش بزرگ چیست؟

آزمایش منتشرشده از یک سر طبقه‌بندی Clef و آداپتورهای LoRA با رنک ۶۴ (Rank-64) برای یک دور آموزش (Epoch) استفاده کرده است. تکنیک LoRA ماتریس‌های کوچک و کم‌رتبه را آموزش می‌دهد و بخش اعظم وزن‌های مدل پایه را دست‌نخورده باقی می‌گذارد که باعث صرفه‌جویی چشمگیر در حافظه مورد نیاز برای آموزش می‌شود. تنظیمات پیش‌فرض و اولیه از وزن‌های پایه ۴ بیتی، آداپتورهای رنک ۱۶ و نرخ یادگیری 2e-4 بهره می‌برد؛ با این حال توسعه‌دهندگانی که می‌خواهند این بنچمارک را عیناً بازتولید کنند، باید حتماً از کانفیگ رنک ۶۴ استفاده کنند تا به همین نتایج درخشان برسند.

مجموعه داده‌های آموزشی این آزمایش شامل ترکیب دیتای typed-decisions با ۱۲ منبع معتبر دسته‌بندی و استنتاج زبان طبیعی بوده است: AG News، ARC، BANKING77، BoolQ، CLINC150، CommonsenseQA، MMLU، MNLI، نمونه‌های تزریق پرامپت (Prompt-injection)، SNLI، SST-5 و WANLI. همچنین دیتاست ارزیابی ۳۰۰۰ ردیفی از ترکیب سه مجموعه typed-decisions، BANKING77 و CLINC150 گلچین شده که طبق اعلام سازندگان، کاملاً پالایش شده تا هیچ داده مشترکی با بخش آموزش نداشته باشد.

با ۴ گیگابایت VRAM چه کار‌هایی می‌توان انجام داد؟

بر اساس گزارش تیم توسعه، میزان دقت نهایی، اوج مصرف حافظه گرافیکی و مدت‌زمان آموزش در مدل‌های مختلف به شرح زیر است:

مدل
دقت در تست
میزان VRAM
زمان آموزش
Qwen3.5-0.8B
۷۸٪
۴ گیگابایت
۴۲ دقیقه
Qwen3.5-2B
۸۱٪
۸ گیگابایت
۴۰ دقیقه
Llama 3.2 3B
۷۹٪
۴.۱ گیگابایت
۳۰ دقیقه
Gemma 4 E4B
۷۷٪
۱۴.۴ گیگابایت
۴۹ دقیقه
Laya (فاین‌تیون مجدد)
۷۷٪
۲.۵ گیگابایت
۱۰ دقیقه

نتیجه مدل Laya حاصل فاین‌تیون بیش‌تر روی یک مدل تصمیم‌گیری از پیش‌آموزش‌دیده است. علاوه بر این، یک اجرای سریع روی مدل Qwen3.5-4B با تنظیم max_steps=60 توانسته ظرف تنها ۱۰ دقیقه روی یک پردازنده گرافیکی Nvidia L4 به دقت ۷۶ درصدی دست پیدا کند. البته مدت‌زمان واقعی و مصرف حافظه بسته به سخت‌افزار، طول ورودی، اندازه بچ (Batch Size)، دقت محاسباتی و ساختار دیتاست شما متغیر خواهد بود.

از آماده‌سازی دیتاست تا پیش‌بینی و اجرا

خبر خوب این است که در نسخه دسکتاپ Unsloth می‌توانید کل این فرایند را حتی بدون نوشتن یک خط کد پایتون اجرا کنید؛ همزمان کتابخانه متن‌باز آن کلاس‌های FastDecisionModel و DecisionTrainer را برای ادغام مستقیم با پایپ‌لاین‌های موجود در اختیارتان می‌گذارد.

  1. یک مدل پایه مانند unsloth/Qwen3.5-4B را انتخاب کنید.
  2. حالت Train as را روی گزینه Decision model قرار دهید.
  3. مجموعه داده برچسب‌گذاری‌شده خود را انتخاب کرده و آموزش را کلید بزنید.

هر نمونه داده آموزشی باید شامل متن مبدأ و پاسخ مورد انتظار برای هر سوال باشد. برچسب‌ها دقیقاً باید با ساختار سوالات، گزینه‌های مجاز یا مقادیر عددی مدنظر همخوانی داشته باشند. برای دسترسی به این ابزار، می‌توانید به مخزن گیتهاب (GitHub) پروژه Unsloth مراجعه کنید که این ماژول را در کنار سایر ابزار‌های کاربردی خود عرضه کرده است.

در محیط پایتون، متد predict یک متن آزاد و دیکشنری از سوالات ساختاریافته را به عنوان ورودی دریافت می‌کند:

answers = FastDecisionModel.predict(
    model,
    tokenizer,
    \"Hi, I was charged twice for invoice #4411. Please refund today.\",
    {
        \"team\": {
            \"type\": \"choice\",
            \"criteria\": {
                \"billing\": \"invoices, payments, refunds\",
                \"technical\": \"bugs, outages, errors\",
                \"sales\": \"pricing, new plans\",
            },
        },
        \"refund\": {
            \"type\": \"bool\",
            \"instructions\": \"Does the customer ask for a refund?\",
        },
    },
)

print(answers[\"team\"][\"probabilities\"])

سنجش میزان اطمینان مدل با معیار ECE

هر پیش‌بینی که توسط مدل انجام می‌شود، علاوه بر گزینه انتخابی، شامل توزیع آماری احتمالات نیز هست. متد calibrate این احتمالات را با درستی واقعی مدل روی داده‌های تست مقایسه کرده و شاخص‌هایی مانند دقت، مقدار خطا (Loss) و خطای کالیبراسیون مورد انتظار (ECE) را گزارش می‌دهد. این معیار پیش‌بینی‌ها را بر اساس ضریب اطمینان دسته‌بندی می‌کند و اختلاف میان میانگین اطمینان و دقت واقعی را می‌سنجد؛ طبیعتاً هر چه مقدار ECE پایین‌تر باشد، مدل قابل‌اعتمادتر است.

کالیبراسیون دقیق به یک دیتاست مجزا و نماینده نیاز دارد؛ چرا که با تغییر الگوهای ترافیک، لحن ورودی‌ها، فراوانی کلاس‌ها یا رفتار کاربران، احتمالات کالیبره‌شده قبلی ممکن است دقت خود را از دست بدهند. به همین دلیل سیستم‌های فعال در محیط واقعی باید مرتباً هم دقت و هم کالیبراسیون را زیر نظر بگیرند و در صورت مشاهده تغییرات رفتاری، مدل را مجدداً کالیبره یا آموزش دهند.

چه کار‌هایی بهترین گزینه برای مدل‌های تصمیم‌گیری هستند؟

بهترین گزینه‌ها برای پیاده‌سازی

  • مسیریابی هوشمند تیکت‌ها و تشخیص قصد کاربر
  • غربالگری و اولویت‌بندی تعدیل محتوا
  • شناسایی و مسدودسازی حملات تزریق پرامپت (Prompt Injection)
  • برچسب‌گذاری اسناد و هدایت شاخه‌های کاری در فرایندها
  • محاسبه امتیاز ریسک بر اساس آستانه‌های مشخص
  • استخراج چندین تصمیم مستقل و مرتبط از یک متن واحد

محدودیت‌ها و نکاتی که باید بسنجید

  • هر پاسخ حتماً باید در قالب یک گزینه مشخص، فیلد بولی (بله/خیر) یا یک مقیاس عددی معین بگنجد.
  • افزایش تعداد سوالات و گزینه‌ها باعث طولانی‌تر شدن پرامپت و سنگین‌تر شدن هزینه پردازش می‌شود.
  • کالیبراسیون ممکن است در مواجهه با تغییرات پیش‌بینی‌نشده در توزیع داده‌ها افت کند.
  • دقت کلی ممکن است عملکرد ضعیف مدل در دسته‌های کمیاب یا پرهزینه را پنهان کند.
  • مدل‌های کلاسیک طبقه‌بندی (مانند انکودرها) همچنان ممکن است سبک‌تر و سریع‌تر اجرا شوند و معیار مقایسه خوبی هستند.
  • تولید متن‌های خلاقانه و وظایفی که به توضیح متنی نیاز دارند، همچنان نیازمند مدل‌های مولد معمولی هستند.

تیم‌هایی که تا امروز تنها برای طبقه‌بندی متون از APIهای گران‌قیمت مدل‌های عمومی استفاده می‌کردند، حالا می‌توانند یک مدل محلی ۰.۸ یا ۳ میلیارد پارامتری سبک با خروجی کاملاً ساختاریافته را تست کنند. مقایسه جامع میان دقت در سطح وظیفه، کالیبراسیون، اوج مصرف رم گرافیکی، تأخیر صدک ۹۵ (p95)، هزینه‌های جاری سرور و زحمت نگهداری سیستم، به روشنی نشان می‌دهد که آیا جایگزینی مدل‌های سنتی یا APIها با این شیوه جدید توجیه اقتصادی دارد یا خیر.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

دردسرهای فنی OpenAI Dots و ظهور شبیه‌سازهای متن‌باز؛ وقتی ایجنت همیشه‌روشن به این سادگی‌ها نیست!
آخرین اخبار

دردسرهای فنی OpenAI Dots و ظهور شبیه‌سازهای متن‌باز؛ وقتی ایجنت همیشه‌روشن به این سادگی‌ها نیست!

سرویس جدید OpenAI Dots با وعده ایجنت‌های ابری همیشه‌روشن عرضه شد، اما بروز اختلالات فنی متعدد و قطعی‌های پی‌درپی حسابی صدای کاربران را درآورده است. هم‌زمان، توسعه‌دهندگان مستقل با عرضه پروژه‌های متن‌بازی چون OpenDots و Open Dot در تلاش‌اند جایگزین‌هایی ارزان‌تر، آزادتر و بدون محدودیت در اختیار همگان بگذارند.

۳ دقیقه مطالعه
۰
۱۶ مهر
دانشمندان آزمایشگاه آرگون میکروسکوپ پرتو ایکس سخنگویی ساختند که با زبان طبیعی فرمان می‌گیرد و زوم می‌کند!
آخرین اخبار

دانشمندان آزمایشگاه آرگون میکروسکوپ پرتو ایکس سخنگویی ساختند که با زبان طبیعی فرمان می‌گیرد و زوم می‌کند!

پژوهشگران آزمایشگاه ملی آرگون با اتصال ایجنت‌های هوش مصنوعی به خط باریکه نانوپروب پرتو ایکس، میکروسکوپی توسعه داده‌اند که دانشمندان می‌توانند به زبان ساده و گفتاری با آن مکالمه کنند و از دستگاه بخواهند روی نقاط دلخواه نمونه زوم کند. این نوآوری با بازسازی بلادرنگ داده‌های سنگین تایکوگرافی، افق‌های تازه‌ای در تحقیقات مواد پیشرفته و ساخت نیمه‌هادی‌ها می‌گشاید.

۴ دقیقه مطالعه
۰
۱۶ مهر
استارتاپ هوش مصنوعی ورنیک راهی اروپا شد؛ تأسیس نخستین مقر در لوکزامبورگ
آخرین اخبار

استارتاپ هوش مصنوعی ورنیک راهی اروپا شد؛ تأسیس نخستین مقر در لوکزامبورگ

استارتاپ هوش مصنوعی ورنیک (Verneek) که توسط نسرین مصطفی‌زاده و امید بخشنده تأسیس شده، قصد دارد با راه‌اندازی نخستین دفتر اروپایی خود در لوکزامبورگ فعالیت‌هایش را گسترش دهد. این شرکت فعال در حوزه هوش مصنوعی سازمانی، با پلتفرم اختصاصی خود به غول‌های خرده‌فروشی کمک می‌کند تا داده‌های پراکنده را یکپارچه کرده و بهره‌وری را افزایش دهند.

۳ دقیقه مطالعه
۰
۱۶ مهر