محققان Together AI مشکل پنهان ناپایداری در آموزش مدلهای زبانی را برطرف کردند
پژوهشگران Together AI با شناسایی یک انحراف پنهان بین سیستمهای آموزش و نمونهبرداری، راهکاری برای رفع ناپایداری در یادگیری تقویتی مدلهای زبانی بزرگ ارائه دادند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- محققان Together AI ریشه ناپایداری در آموزش یادگیری تقویتی (RL) مدلهای زبانی را کشف و راهکار جدیدی برای آن ارائه کردند.
- روش پیشنهادی به نام «مرکزیت امتیاز» (Score Centering)، سوگیری ناشی از تفاوتهای محاسباتی سیستمهای آموزش و استنتاج را با کمتر از ۱ درصد سربار زمانی برطرف میکند.
- این دستاورد با حذف انحرافهای وابسته به پاداش، پایداری حلقههای بازخورد در آموزش آنلاین مدلهای هوش مصنوعی را به میزان قابلتوجهی افزایش میدهد.
تمرکز بر رفع انحراف سیاست در یادگیری تقویتی مدلهای زبانی
یادگیری تقویتی در مدلهای زبانی بزرگ (LLM) معمولاً از یک سیستم برای تولید خروجیها و از سیستمی دیگر برای محاسبه گرادیانها استفاده میکند. تفاوتهای عددی کوچک میان این دو سیستم میتواند روند آموزش را دچار ناپایداری کند؛ حتی زمانی که هر دو از وزنهای مدل یکسانی استفاده میکنند. در مقالهای جدید، محققان Together AI به نامهای مارتین مارک و مکس ریابینین ریشه این ناپایداری را در یک سوگیری در گرادیان سیاست ردیابی کرده و اصلاحیهای به نام «مرکزیت امتیاز» (Score Centering) پیشنهاد دادهاند.
این روش، امتیاز موردانتظار نمونهبردار در هر پیشوند توکن را تفریق میکند. این کار بدون نیاز به برش نسبت اهمیت، سوگیری را از بین میبرد. بر اساس آزمایشهای انجامشده، این تکنیک کمتر از ۱ درصد سربار زمانی به سیستم اضافه میکند و قابلیت ترکیب با روشهای موجود نمونهبرداری اهمیتی را نیز دارد.
یک سیاست، دو مسیر محاسباتی متفاوت
پشتههای نرمافزاری یادگیری تقویتی در محیطهای عملیاتی، معمولاً فرآیند تولید خروجی را از بهینهسازی جدا میکنند. یک موتور استنتاج مانند vLLM یا SGLang نمونهبرداری توکنها را بر عهده دارد، در حالی که یک چارچوب آموزشی مسیرهای رفت و برگشت را اجرا میکند. این دو سیستم ممکن است به دلایل زیر توزیعهای متفاوتی برای توکن بعدی از یک نقطه بازرسی (Checkpoint) یکسان تولید کنند:
- تفاوت در دقت عددی، کرنلها یا ترتیب محاسبات تقلیلی
- استنتاج خودهمبسته در ترکیب با آموزش موازیتوالی
- وزنها، فعالسازیها یا حافظههای پنهان کلید-مقدار کمّیشده
- استفاده از نمونهبردارهای قدیمی که بر اساس نقاط بازرسی پیشین خروجی تولید میکنند
در روشهای تنظیم دقیق نظارتشده، از آنجا که توزیع دادهها ثابت میماند، سیستم میتواند تفاوتهای بسیار بزرگتری را تحمل کند. در این حالت یک مدل میتواند از طریق آموزش معمولی با روش حداکثر احتمال، از خروجیهای مدلی دیگر یاد بگیرد. اما یادگیری تقویتی آنلاین یک حلقه بازخورد ایجاد میکند: سیستم آموزشدهنده بهروزشده، نمونهبردار بعدی را تولید میکند و سپس تقریبهای عددی آن بر بهروزرسانیهای بعدی تأثیر میگذارند.
مارک و ریابینین در آزمایشی روی مدل Qwen3-1.7B، این حلقه بازخورد را با ایجاد اختلال در وزنهای نمونهبردار ایزوله کردند. نتایج نشان داد که آموزش آنلاین با پاداشهای کاملاً مثبت کمترین پایداری را دارد؛ در حالی که برچسبهای مثبت در آموزش آفلاین مشکلی ایجاد نمیکنند. این نتیجهگیری به یک سوگیری وابسته به پاداش اشاره دارد که با هر بار نوسازی نمونهبردار، انباشته و تشدید میشود.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.