پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

محققان Together AI مشکل پنهان ناپایداری در آموزش مدل‌های زبانی را برطرف کردند

انتشار:۳۱ شهریور ۱۴۰۵(۵ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

پژوهشگران Together AI با شناسایی یک انحراف پنهان بین سیستم‌های آموزش و نمونه‌برداری، راهکاری برای رفع ناپایداری در یادگیری تقویتی مدل‌های زبانی بزرگ ارائه دادند.

محققان Together AI مشکل پنهان ناپایداری در آموزش مدل‌های زبانی را برطرف کردند

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • محققان Together AI ریشه ناپایداری در آموزش یادگیری تقویتی (RL) مدل‌های زبانی را کشف و راهکار جدیدی برای آن ارائه کردند.
  • روش پیشنهادی به نام «مرکزیت امتیاز» (Score Centering)، سوگیری ناشی از تفاوت‌های محاسباتی سیستم‌های آموزش و استنتاج را با کمتر از ۱ درصد سربار زمانی برطرف می‌کند.
  • این دستاورد با حذف انحراف‌های وابسته به پاداش، پایداری حلقه‌های بازخورد در آموزش آنلاین مدل‌های هوش مصنوعی را به میزان قابل‌توجهی افزایش می‌دهد.

تمرکز بر رفع انحراف سیاست در یادگیری تقویتی مدل‌های زبانی

یادگیری تقویتی در مدل‌های زبانی بزرگ (LLM) معمولاً از یک سیستم برای تولید خروجی‌ها و از سیستمی دیگر برای محاسبه گرادیان‌ها استفاده می‌کند. تفاوت‌های عددی کوچک میان این دو سیستم می‌تواند روند آموزش را دچار ناپایداری کند؛ حتی زمانی که هر دو از وزن‌های مدل یکسانی استفاده می‌کنند. در مقاله‌ای جدید، محققان Together AI به نام‌های مارتین مارک و مکس ریابینین ریشه این ناپایداری را در یک سوگیری در گرادیان سیاست ردیابی کرده و اصلاحیه‌ای به نام «مرکزیت امتیاز» (Score Centering) پیشنهاد داده‌اند.

این روش، امتیاز موردانتظار نمونه‌بردار در هر پیشوند توکن را تفریق می‌کند. این کار بدون نیاز به برش نسبت اهمیت، سوگیری را از بین می‌برد. بر اساس آزمایش‌های انجام‌شده، این تکنیک کمتر از ۱ درصد سربار زمانی به سیستم اضافه می‌کند و قابلیت ترکیب با روش‌های موجود نمونه‌برداری اهمیتی را نیز دارد.

یک سیاست، دو مسیر محاسباتی متفاوت

پشته‌های نرم‌افزاری یادگیری تقویتی در محیط‌های عملیاتی، معمولاً فرآیند تولید خروجی را از بهینه‌سازی جدا می‌کنند. یک موتور استنتاج مانند vLLM یا SGLang نمونه‌برداری توکن‌ها را بر عهده دارد، در حالی که یک چارچوب آموزشی مسیرهای رفت و برگشت را اجرا می‌کند. این دو سیستم ممکن است به دلایل زیر توزیع‌های متفاوتی برای توکن بعدی از یک نقطه بازرسی (Checkpoint) یکسان تولید کنند:

  • تفاوت در دقت عددی، کرنل‌ها یا ترتیب محاسبات تقلیلی
  • استنتاج خودهمبسته در ترکیب با آموزش موازی‌توالی
  • وزن‌ها، فعال‌سازی‌ها یا حافظه‌های پنهان کلید-مقدار کمّی‌شده
  • استفاده از نمونه‌بردارهای قدیمی که بر اساس نقاط بازرسی پیشین خروجی تولید می‌کنند

در روش‌های تنظیم دقیق نظارت‌شده، از آنجا که توزیع داده‌ها ثابت می‌ماند، سیستم می‌تواند تفاوت‌های بسیار بزرگ‌تری را تحمل کند. در این حالت یک مدل می‌تواند از طریق آموزش معمولی با روش حداکثر احتمال، از خروجی‌های مدلی دیگر یاد بگیرد. اما یادگیری تقویتی آنلاین یک حلقه بازخورد ایجاد می‌کند: سیستم آموزش‌دهنده به‌روزشده، نمونه‌بردار بعدی را تولید می‌کند و سپس تقریب‌های عددی آن بر به‌روزرسانی‌های بعدی تأثیر می‌گذارند.

مارک و ریابینین در آزمایشی روی مدل Qwen3-1.7B، این حلقه بازخورد را با ایجاد اختلال در وزن‌های نمونه‌بردار ایزوله کردند. نتایج نشان داد که آموزش آنلاین با پاداش‌های کاملاً مثبت کمترین پایداری را دارد؛ در حالی که برچسب‌های مثبت در آموزش آفلاین مشکلی ایجاد نمی‌کنند. این نتیجه‌گیری به یک سوگیری وابسته به پاداش اشاره دارد که با هر بار نوسازی نمونه‌بردار، انباشته و تشدید می‌شود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر