پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

جهش ۱۲ امتیازی مدل LFM2.5 در ۴ محیط مختلف؛ راهکار جدید هاگینگ‌فیس و لیکوئید ای‌آی برای ایجنت‌های کدنویسی

انتشار:۱۰ مهر ۱۴۰۵(۱ ساعت پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

هاگینگ‌فیس و لیکوئید ای‌آی از فریم‌ورک متن‌باز جدیدی رونمایی کرده‌اند که امکان آموزش ایجنت‌های کدنویسی را از طریق یادگیری تقویتی در چندین محیط مختلف فراهم می‌کند. با این راهکار نوآورانه، مدل سبک LFM2.5 توانسته در چهار محیط ایجنت معروف جهش چشمگیر ۱۲ امتیازی را ثبت کند و تعداد فراخوانی ابزار‌ها را به شکلی محسوس کاهش دهد. این دستاورد مسیر را برای توسعه ایجنت‌های هوشمند چندمنظوره و سازگار با انواع پلتفرم‌ها هموارتر می‌کند.

جهش ۱۲ امتیازی مدل LFM2.5 در ۴ محیط مختلف؛ راهکار جدید هاگینگ‌فیس و لیکوئید ای‌آی برای ایجنت‌های کدنویسی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • هاگینگ‌فیس و لیکوئید ای‌آی با انتشار یک استک متن‌باز، امکان آموزش ایجنت‌های کدنویسی مثل Claude Code و Codex رو با یادگیری تقویتی (RL) و بدون نیاز به دستکاری کدهای اصلی‌شون فراهم کردن.
  • با این روش نوین، دقت مدل جمع‌وجور LFM2.5-2.6B در حل چالش‌ها در چهار محیط مختلف از ۴۲.۲ به ۵۴.۲ درصد رسید و تعداد فراخوانی ابزارهاش هم ۳۱ درصد کم‌تر و بهینه‌تر شد.
  • این فریم‌ورک با یه پروکسی هوشمند بین محیط ایجنت و سرور مدل، زبان و پروتکل‌های مختلف رو یکدست می‌کنه تا مدل‌ها بدون خطا روی هر پلتفرمی با بالا‌ترین کارایی اجرا بشن.

یک مدل، چهار محیط اجرایی و ۱۲ امتیاز ارتقا

شاید براتون جالب باشه که وزن‌های کاملاً یکسان یک مدل هوش مصنوعی می‌تونن در یک محیط ایجنت (Agent Harness) امتیاز ۵۲ درصد بیارن و در محیطی دیگه امتیازشون به ۲۳ درصد سقوط کنه! دلیلش هم ساده‌ست: نرم‌افزاری که مدل رو احاطه کرده، دقیقاً تعیین می‌کنه که مدل چه چیز‌هایی رو ببینه و دستوراتش چطور اجرا بشن. هارنس یا چارچوب یک ایجنت وظیفه جمع‌آوری بستر متنی (Context)، ارسال فراخوانی ابزارها، پردازش پاسخ‌ها و تصمیم‌گیری درباره زمان پایان کار رو به دوش می‌کشه. حالا هاگینگ‌فیس و لیکوئید ای‌آی (Liquid AI) یک استک متن‌باز برای یادگیری تقویتی (RL) درون محیط‌های عملیاتی و واقعی مثل Claude Code، Codex و OpenCode منتشر کرده‌ان که نیازی به دستکاری کدهای اصلی این محیط‌ها نداره.

طبق گزارش راهنمای یادگیری تقویتی چندمحیطی (Multi-Harness RL)، آزمایش اصلی نشون داده که دقت مدل LFM2.5-2.6B بر اساس معیار pass@1 در چهار محیط مختلف از ۴۲.۲ درصد به ۵۴.۲ درصد جهش کرده است. معیار pass@1 نشون‌دهنده سهم تسک‌هایی هست که در همون تلاش اول با موفقیت حل می‌شن. جالب‌تر اینکه این مدل آموزش‌دیده در وظایفی که هر دو مدل (پایه و جدید) حل کردن، ۳۱ درصد کم‌تر به سراغ فراخوانی ابزار‌ها رفته و بسیار بهینه‌تر عمل کرده. حالا پروکسی ضبط داده‌ها، ادغام با بخش آموزش، مجموعه تسک‌ها، داده‌های فاین‌تیونینگ نظارت‌شده و هر هفت چک‌پوینت آموزش‌دیده به شکل عمومی و رایگان در دسترس همگان قرار گرفته است.

انتخاب محیط ایجنت می‌تواند امتیاز مدل را نصف کند!

اجرای وزن‌های کاملاً یکسان یک مدل در ابزار‌هایی مثل Claude Code، Cursor یا Cline می‌تونه رفتارهای کاملاً متفاوتی ایجاد کنه؛ چون هر محیط هارنس، پرامپت‌ها، ابزارها، ساختار داده‌ها، منطق تلاش مجدد (Retry) و قوانین توقف مخصوص خودش رو داره. بنابراین مدل نه فقط باید اصل کار رو یاد بگیره، بلکه باید قلق‌های محیط و رابطی رو هم که توش کار می‌کنه یاد بگیره.

برای مثال، در بنچمارک SWE-bench Pro مدل GLM-5.2 در یک محیط خاص امتیاز ۲۳ درصد گرفت، اما در محیطی دیگه به امتیاز فوق‌العاده ۵۲ درصد رسید! حتی رتبه‌بندی هارنس‌ها هم با تغییر مدل عوض شد: پلتفرم Codex بین ده محیط مختلف برای مدل GLM-5.2 در رتبه دوم ایستاد، در حالی که برای مدل Gemma 4 26B-A4B رتبه‌ای بهتر از نهم پیدا نکرد.

میزان دقت pass@1 و هزینه به ازای هر تسک برای GLM-5.2 و Gemma 4 26B-A4B در محیط‌های مختلف کدنویسی در SWE-bench Pro
دقت و هزینه عملکرد مدل‌ها با تغییر محیط هارنس در بنچمارک SWE-bench Pro دستخوش تغییرات چشمگیری می‌شود.

مدل‌های با وزن باز (Open-weight) وقتی فقط در یک محیط آموزش می‌بینن، با چالش جدی انتقال تجربه روبه‌رو می‌شن. مدلی که فقط برای یک فریم‌ورک تربیت شده، ممکنه سراغ ابزار‌های ناموجود بره، آرگومان‌هایی تولید کنه که محیط قادر به خواندنشون نیست، یا الگوهایی از جریان کنترل رو پیش بگیره که فقط مختص همون محیط اولیه بوده. مقاله تحقیقاتی Orchard این اثر منفی رو به‌خوبی ثبت کرده: وقتی مدل OpenSWE-32B از پلتفرم OpenHands به Kimi-CLI منتقل شد، امتیازش در بنچمارک SWE-bench Verified با سقوط سنگین ۵۸.۸ امتیازی به تنها ۳.۶ درصد رسید و در Terminal-Bench 2.0 هم امتیاز صفر دشت کرد! مدل Scale-SWE هم فقط و فقط در همون محیطی که آموزش دیده بود می‌تونست ابزار‌ها رو به‌درستی فراخوانی کنه.

یک پروکسی هوشمند که جعبه‌های سیاه را آموزش‌پذیر می‌کند

آموزش چندمحیطی (Multi-harness) با قرار دادن یک پروکسی ضبط داده (Capture Proxy) میان هر محیط هارنس و سرور استنتاج vLLM کار می‌کنه. توسعه‌دهندگان کافیه محیط ایجنت رو جوری تنظیم کنن که از این پروکسی به‌عنوان اندپوینت مدل استفاده کنه. به این ترتیب، هارنس با همون گویش و قالب API بومی خودش ارتباط برقرار می‌کنه، در حالی که پروکسی در پس‌زمینه تمام داده‌های حیاتی برای یادگیری تقویتی رو ضبط و ذخیره می‌کنه.

  1. تشخیص پروتکل: پروکسی یکی از چهار فرمت API پشتیبانی‌شده رو از روی مسیر درخواست، هدرها و بدنه پیام شناسایی می‌کنه.
  2. استانداردسازی درخواست: مبدل‌هایی که از درگاه Polar شرکت انویدیا (NVIDIA) اقتباس شده‌ان، درخواست دریافتی رو به قالب استاندارد Chat Completions تبدیل می‌کنن.
  3. ثبت نمونه: سرور vLLM شناسه‌های دقیق توکن‌های نمونه‌برداری‌شده (Token IDs) و لاگ احتمالات پردازش‌شده اون‌ها رو برمی‌گردونه.
  4. بازپخش پاسخ: پروکسی پاسخ نهایی رو دوباره به قالبی که همون محیط ایجنت انتظار داره تبدیل می‌کنه و تحویلش میده.

به‌روزرسانی‌های گرادیان خط‌مشی (Policy-Gradient) به تک‌تک توکن‌های دقیق تولیدشده در طول مسیر و احتمالات دقیق ثبت‌شده برای هر کدوم نیاز دارن. اگر فقط متن پاسخ رو ذخیره کنیم و بعداً دوباره توکنایزش کنیم، ممکنه برای همون متن یکسان، شناسه‌های توکن متفاوتی تولید بشه! علاوه بر این، محیط‌های مختلف ممکنه نشانگرهای نقش (Role markers) اضافه کنن، فاصله‌ها رو دستکاری کنن یا JSON ناقص رو اصلاح کنن؛ اتفاقاتی که باعث میشه متن ضبط‌شده با نمونه اولیه مدل فاصله بگیره.

همچنین اجراهای پیچیده و نامنظم ایجنت‌ها نیازمند بازسازی ساختار هستن؛ چون مواردی مثل تلاش‌های مجدد، ساب‌ایجنت‌ها و فشرده‌سازی متن بستر می‌تونن انشعاب‌های درختی بسازن. این پروکسی هر فراخوانی مدل رو مثل یک نود ذخیره می‌کنه و سپس اون رو به فراخوانی قبلی متصل می‌کنه؛ همون فراخوانی‌ای که پرامپت و خروجی‌اش طولانی‌ترین پیشوند توکن مشترک با پرامپت جدید رو شکل داده باشن. ادامه مسیرهای عادی یک شاخه رو گسترش میدن، تلاش‌های مجدد تبدیل به گره‌های هم‌سطح (Siblings) می‌شن و درخواست‌های با پیشوند نامرتبط هم ریشه‌های جدیدی رو رقم می‌زنن. در نهایت، هر مسیر از ریشه تا برگ، به یک توالی آموزشی ارزشمند تبدیل میشه.

هشت اجرای همزمان؛ خلق یک سیگنال یادگیری دقیق

این آزمایش‌ها با استفاده از مدل LFM2.5-2.6B روی مجموعه دادگان SmolDataEnvs (شامل ۱۰۰۰ تسک تحلیل داده برگرفته از نوتبوک‌های کگل) اجرا شد. هر دو فرایند آموزش از الگوریتم Async GRPO استفاده کردن؛ این الگوریتم پیاده‌سازی ناهمگام بهینه‌سازی خط‌مشی نسبی گروهی در کتابخانه TRL هست که برای ۱۰۰۰ گام آموزشی روی دو پردازنده گرافیکی قدرتمند H100 اجرا شد.

نوع اجرا
محیط‌های هارنس انتخابی
فقط OpenCode
تمام اجراها منحصراً در محیط OpenCode انجام شدند.
چندمحیطی (Multi-harness)
هر گروه از ترکیبی شامل OpenCode، Claude Code، Codex یا Mini-SWE-Agent استفاده کرد.

هر گروه GRPO شامل هشت تلاش برای انجام یک تسک یکسان بود. پاسخ درست ۱ امتیاز، پاسخ غلط ۰ امتیاز و پاسخ درستی که از ابزار‌های کمتری استفاده کرده بود تا سقف ۰.۱ پاداش کارایی (Efficiency Bonus) دریافت می‌کرد. روش GRPO عملکرد هر اجرا رو با میانگین پاداش همون گروه مقایسه می‌کنه. اگر هر هشت تلاش به پاسخ درست می‌رسیدن، پاداش درستی پاسخی واریانسی نداشت؛ بنابراین پاداش مصرف بهینه ابزار نقش سیگنال یادگیری رو بازی می‌کرد و به نفع مسیرهای موفق‌تر و کوتاه‌تر وارد عمل می‌شد.

آموزش همه‌جانبه مصرف ابزار‌ها را کاهش می‌دهد

آموزش همزمان روی چهار محیط باعث بهبود قابلیت انتقال و کارایی مدل شد، در حالی که مدل آموزش‌دیده روی یک محیط تنها در خانه خودش درخشید!

  • دقت چندمحیطی: یادگیری تقویتی چندمحیطی میانگین کلی pass@1 را از ۴۲.۲ درصد به ۵۴.۲ درصد رساند و در هر چهار محیط رشد محسوسی ثبت کرد.
  • اوج در محیط خانگی: مدلی که فقط با OpenCode آموزش دید، در محیط OpenCode به رکورد ۵۸ درصد رسید؛ اما مدل چندمحیطی در پلتفرم‌های Claude Code و Codex عملکرد به‌مراتب برتر و باثبات‌تری به نمایش گذاشت.
  • کارایی ابزار‌ها: در تسک‌هایی که توسط هر دو نسخه با موفقیت حل شدند، مدل چندمحیطی ۳۱ درصد کم‌تر از مدل پایه به فراخوانی ابزار‌ها دست زد. این کاهش برای مدل تک‌محیطی تنها ۱۱ درصد بود.
  • افت در محیط‌های غریبه: مدل تک‌محیطی OpenCode وقتی در محیط Claude Code قرار گرفت، حتی نسبت به مدل پایه فراخوانی ابزار و توکن بیشتری مصرف کرد و دچار پسرفت شد!

پیروزی مقتدرانه یادگیری تقویتی بر روش تقطیر مسیر

تیم تحقیقاتی روش فاین‌تیونینگ نظارت‌شده (SFT) را نیز با استفاده از مسیرهای موفق یک مدل معلم بزرگ‌تر محک زد. آن‌ها مدل توانمند Qwen3.8-27B را در هر چهار محیط اجرا کردند، ۳۱۸۹ اجرای پیروزمندانه را جدا کردند و مدل LFM2.5-2.6B را با این داده‌ها آموزش دادند.

مقایسه جداگانه نتایج تقطیر دانش (Distillation) نشان‌دهنده ارقام زیر در شاخص pass@1 بود:

روش آموزش
شاخص Pass@1
یادگیری تقویتی چندمحیطی (Multi-harness RL)
۵۴.۶٪
فاین‌تیونینگ در OpenCode (روش SFT)
۴۷.۵٪
فاین‌تیونینگ چندمحیطی (Multi-harness SFT)
۴۳.۱٪

جالب اینجاست که در محیط Mini-SWE-Agent، روش فاین‌تیونینگ چندمحیطی حتی امتیاز مدل پایه رو از ۶۲.۱ درصد به ۴۵.۲ درصد کاهش داد و پیشرفت‌های حاصل در سه محیط دیگه رو خنثی کرد! دلیلش اینه که روش SFT فقط روی تقلید شانس توالی‌های موفق مدل معلم تمرکز می‌کنه؛ اما یادگیری تقویتی مستقیماً رفتارهای جدیدی رو از سیاست خودِ مدل دانش‌آموز تولید می‌کنه و اون‌ها رو بر اساس پاداش‌های هر تسک بهبود میده. این یعنی مدل فرصت پیدا می‌کنه تا از اشتباهات و رفتارهای خودش در هر محیط درس بگیره.

نمونه‌برداری کامل و بدون هرس توکن‌ها

این پروکسی با تنظیم top_p روی مقدار 1.0 و غیرفعال‌سازی هرس top_k، نمونه‌برداری رو از کل توزیع احتمالات مدل انجام میده. فرایند هرس کردن (Truncation) توزیع اجراها رو تغییر میده و می‌تونه فروپاشی آنتروپی (Entropy Collapse) رو در طول یادگیری تقویتی تسریع کنه. علاوه بر این، هرس کردن روی لاگ احتمالات خروجی vLLM هم اثر منفی می‌ذاره و باعث عدم تطابق بین رفتار ثبت‌شده در طول اجرا و سیاست مورد استفاده در آموزش میشه.

وقتی نسبت نمونه‌برداری اهمیت (Importance-Sampling Ratio) نزدیک به عدد ۱ باشه، نشون میده که احتمالات زمان اجرا با احتمالات آموزش کاملاً هم‌راستا هستن. جالب اینجاست که تغییر top_p به 1.0 باعث شد این نسبت از محدوده ۰.۹۸۵ تا ۰.۹۹۳ به عدد چشمگیر ۰.۹۹۸۴ تا ۰.۹۹۹۹ ارتقا پیدا کنه.

فلگ‌های ضروری برای اجرای vLLM

vllm serve <model> --return-tokens-as-token-ids --logprobs-mode processed_logprobs

ابزار‌هایی که توسعه‌دهندگان می‌توانند همین حالا اجرا کنند

توسعه‌دهندگان مدل‌های پیشرو هم‌اکنون آموزش روی چندین محیط هارنس مختلف رو در دستور کار دارن؛ برای نمونه، مدل Kimi K3 محیط‌های Claude Code و Codex رو از ماژول‌های ترکیبی می‌سازه. همچنین مدل Qwen3-Coder-Next داده‌های ایجنتی رو در شش محیط مختلف تولید می‌کنه و پروژه Poolside هم از مسیرهای اجرایی OpenHands، OpenCode و Mini-SWE-Agent بهره می‌بره.

پروژه Harbor 0.22.0 آداپتورهایی برای بیش از ۴۰ محیط ایجنت فراهم کرده و پروژه OpenEnv نیز ده محیط مختلف رو به‌صورت سرتاسری اعتبارسنجی کرده است. این سطح از پوشش فوق‌العاده حیاتیه؛ چرا که مدل‌ها پس از استقرار در دنیای واقعی با رابط‌ها، الگوهای ابزار و حلقه‌های کنترلی مواجه می‌شن که شاید در زمان آموزش اولیه هیچ اثری ازشون نبوده است.

بخش‌های منتشرشده
کاربرد
ثبت درخواست‌ها، توکن‌های نمونه‌برداری‌شده، لاگ احتمالات و ساختار مسیرهای اجرایی.
تعریف محیط‌ها و اجرای فرایندهای آموزش چندمحیطی.
اتصال اجراهای ناهمگام به فرایند آموزش الگوریتم GRPO.
مجموعه SmolDataEnvs
ارائه ۱۰۰۰ وظیفه تکرارپذیر در حوزه تحلیل داده‌ها.
داده‌های SFT و چک‌پوینت‌ها
ارائه مسیرهای اجرای مدل معلم و انتشار تمام هفت نسخه آموزش‌دیده.

تیم‌های هوش مصنوعی می‌تونن به‌راحتی اندپوینت مدل هر محیط هارنس رو به این پروکسی هدایت کنن، قالب بومی درخواست و پاسخ اون رو دست‌نخورده نگه دارن و وزن‌های مدل رو دقیقاً در برابر همون حلقه‌های ابزاری آموزش بدن که قرار است در دنیای واقعی به کار بروند. این استک منتشرشده بدون نیاز به ساخت یا نگهداری فورک‌های سفارشی و اختصاصی، امکان آموزش یادگیری تقویتی رو برای Claude Code، Codex، OpenCode و سایر محیط‌های محبوب فراهم می‌کنه.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

درخشش دی‌جی هوش مصنوعی در رادیوی لس‌آنجلس؛ مجریان واقعی حسابی شاکی شدند!
آخرین اخبار

درخشش دی‌جی هوش مصنوعی در رادیوی لس‌آنجلس؛ مجریان واقعی حسابی شاکی شدند!

دی‌جی هوش مصنوعی جدیدی به نام «کویوتک» حسابی در رادیوی لس‌آنجلس گل کرده و با جذب مخاطبان، حالا پایش به چندین شهر دیگر هم باز شده است. اما در شرایطی که صنعت رادیو با موج شدید تعدیل نیرو دست‌وپنجه نرم می‌کند، درخشش این گوینده مجازی صدای اعتراض مجریان واقعی و اتحادیه‌های صنفی را بلند کرده است.

۵ دقیقه مطالعه
۰
۱۰ مهر
شگفتی در عصر هوش مصنوعی؛ چرا حتی قدرتمندترین مدل‌ها هم جای حس ناب انسانی را نمی‌گیرند؟
آخرین اخبار

شگفتی در عصر هوش مصنوعی؛ چرا حتی قدرتمندترین مدل‌ها هم جای حس ناب انسانی را نمی‌گیرند؟

این روز‌ها پیشرفت‌های خیره‌کننده هوش مصنوعی مدام هوش از سرمان می‌برد، اما نباید یادمان برود که اصیل‌ترین حس شگفتی از دل کار‌های انسانی متولد می‌شود. پژوهش‌های علمی نشان می‌دهد آنچه بیش از هر شاهکار ماشینی انسان‌ها را به وجد می‌آورد، شجاعت، مهربانی و ازخودگذشتگی همنوعان ماست، نه فقط قدرت الگوریتم‌ها.

۴ دقیقه مطالعه
۰
۱۰ مهر
از عکس یخچال تا سفارش غذا؛ ایجنت هوش مصنوعی دوردش به آی‌مسیج اپل آمد!
آخرین اخبار

از عکس یخچال تا سفارش غذا؛ ایجنت هوش مصنوعی دوردش به آی‌مسیج اپل آمد!

دوردش در حال آزمایش یک ایجنت هوش مصنوعی اختصاصی در آی‌مسیج اپل است که فرآیند سفارش غذا را به سادگی ارسال یک پیامک می‌کند. این ایجنت هوشمند حتی می‌تواند با تحلیل عکس یخچال شما، ایده آشپزی پیشنهاد دهد و مواد لازم کسری را خودکار به سبد خرید اضافه کند؛ هرچند نسخه بتای آن فعلاً با خطاهایی مثل قیمت‌های اشتباه دست‌وپنجه نرم می‌کند.

۳ دقیقه مطالعه
۰
۱۰ مهر