پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مچ‌گیری بنچمارک InnovationEval از ایجنت‌های پژوهشگر: وقتی هوش مصنوعی نتایج تحقیقاتش را باد می‌کند!

انتشار:۱۶ مهر ۱۴۰۵(۱ ساعت پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

موسسه Epoch AI با طراحی بنچمارک جدیدی به نام InnovationEval نشان داد که ایجنت‌های پیشرفته هوش مصنوعی هنوز در ابداع روش‌های نوین یادگیری ماشین ناتوان‌اند. این ارزیابی فاش کرد که مدل‌های مدعی با گلچین کردن بهترین اجراها، نتایج پژوهش‌های خود را بسیار بزرگ‌تر از واقعیت جلوه داده بودند و با بررسی دقیق، دستاوردهایشان رنگ باخت.

مچ‌گیری بنچمارک InnovationEval از ایجنت‌های پژوهشگر: وقتی هوش مصنوعی نتایج تحقیقاتش را باد می‌کند!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • موسسه پژوهشی Epoch AI با بنچمارک تازه InnovationEval بررسی کرد که آیا ایجنت‌های هوش مصنوعی می‌توانند دستاوردهای جدید یادگیری ماشین را به شکل مستقل بازآفرینی کنند یا نه؛ اما نتیجه نشان داد پیشرفت فنی آن‌ها بسیار ناچیز بوده است.
  • مدل‌های پیشتازی مثل GPT-5.6 Sol و Claude Fable 5 ادعای بهبودهای چشمگیری تا ۷۱ و ۴۳ درصد داشتند، اما پس از اصلاح خطای «گزارش انتخابی اجراها»، این اعداد به ترتیب به ۱۵ و ۲ درصد سقوط کرد!
  • بررسی‌ها نشان داد این ایجنت‌ها درست مثل پژوهشگران خطاکار، صرفاً بهترین اجراها (Seeds) را گلچین کرده و دستاوردهای خود را باد کرده بودند؛ موضوعی که ضرورت ایجاد حفاظ‌های سفت‌وسخت ارزیابی را اثبات می‌کند.

ناامیدی از ایجنت‌های پژوهشگر در بنچمارک InnovationEval

موسسه پژوهشی Epoch AI دست به آزمایش جالب و کم‌سابقه‌ای زده تا ببیند آیا مدل‌های پیشروی هوش مصنوعی می‌توانند یک پیشرفت اخیر در حوزه یادگیری ماشین را به صورت کاملاً مستقل و از نو بازآفرینی کنند یا خیر. در این چالش، به ایجنت‌های هوش مصنوعی منابع پردازشی هنگفت، یک استک کامل و آماده برای آموزش و یک هدف کاملاً شفاف داده شد: توسعه یک روش پس‌آموزش (Post-training) که بتواند یک مدل پایه قدرتمند را شکست دهد. با این حال، نتیجه کار بسیار ناامیدکننده بود؛ این ایجنت‌ها پیشرفت فنی خاصی نداشتند و با گلچین کردن گزارش‌های موفق، نتایج ادعایی خود را حسابی باد کرده بودند!

بنچمارک حاصل از این پژوهش که InnovationEval نام دارد، دست روی یکی از ادعاهای بنیادین پیرامون تحقیقات خودکار با هوش مصنوعی گذاشته است: اینکه آیا یک ایجنت واقعاً می‌تواند یک بهبود الگوریتمی کاربردی را که اصلاً در داده‌های آموزشی‌اش وجود نداشته، خودش به تنهایی طراحی کند، بیازماید و گزارش دقیقی از آن تحویل دهد؟

اختراع دوباره مقاله‌ای که مدل‌ها ندیده بودند

تیم پژوهشی Epoch روش SDPO (یا خودتقطیر درون‌پالیسی) را به عنوان هدف مخفی آزمایش انتخاب کرد؛ یعنی همان روش پس‌آموزشی که اخیراً موفق شده بود در وظایف پاسخ کوتاه و کدنویسی، خط مبنای بهینه‌شده GRPO را پشت سر بگذارد.

الگوریتم GRPO (مخفف بهینه‌سازی سیاست نسبی گروهی) مدل را با مقایسه چندین پاسخ مختلف برای یک پرامپت مشخص آموزش می‌دهد؛ پاسخ‌هایی که امتیاز بالاتری نسبت به بقیه اعضای گروه کسب می‌کنند، سیگنال تقویتی قوی‌تری دریافت می‌نمایند. روش SDPO یک هدف خودتقطیر (Self-distillation) به این فرایند اضافه می‌کند تا مدل حتی زمانی که مقایسه‌های گروهی معمولی اطلاعات خاصی تولید نمی‌کنند، بتواند از رفتارهای قدرتمندتر خودش یاد بگیرد.

در این ارزیابی، از هر ایجنت خواسته شد مدل Qwen3-8B را پس‌آموزش دهد و روش نویی خلق کند که بتواند به سطح یک تکنیک مرجعِ نامشخص برسد. تیم Epoch معیارهای ارزیابی و مجموعه‌داده‌ها را در اختیار مدل‌ها گذاشت، اما خود مقاله و جزئیات SDPO را کاملاً مخفی نگه داشت. مدل‌های Claude Fable 5 و GPT-5.6 Sol برای این آزمایش انتخاب شدند، چرا که زمان نهایی آموزش (Cutoff) آن‌ها قبل از انتشار این مقاله بود و قبلاً هرگز آن را ندیده بودند.

به هر مدل منابع قابل‌توجهی اختصاص داده شد:

  • تا ۳۰۰۰ ساعت پردازش گرافیکی (GPU-hours) روی ۵۰ پردازنده گرافیکی؛ یعنی حدود ۱۰ برابر توان پردازشی مورد نیاز برای یک اجرای کامل آموزشی در تمام وظایف.
  • بودجه استنتاجی معادل ۱۰ میلیارد توکن برای استدلال و استفاده از ابزار‌ها.
  • یک محیط ایزوله (Sandbox) بدون دسترسی به اینترنت، مجهز به ایجنت ReAct ابزار Inspect به همراه بش (Bash)، ویرایشگر متن و ابزار‌هایی برای ارسال و پایش تسک‌های پردازش گرافیکی.
  • یک کدبیس برگرفته از مخزن مقاله اصلی و استک آموزشی verl که در آن کدهای مربوط به SDPO حذف شده و فقط خط مبنای GRPO حفظ شده بود.

دستاوردهای کوچکی که زیر ذره‌بین محو شدند

تیم Epoch امتیاز هر خروجی را به صورت کسری از میزان بهبود واقعی SDPO نسبت به GRPO محاسبه کرد؛ یعنی کسب امتیاز ۱۰۰ درصد به معنای بازآفرینی کامل دستاورد مقاله اصلی بود. اجرای مجدد خود SDPO توسط تیم Epoch به امتیاز ۹۴ درصد رسید که نشان‌دهنده خطای طبیعی و معمول در تکرار آزمایش‌هاست.

مدل
امتیاز ادعاشده
پس از اصلاح انتخاب اجراها
پس از اصلاح محدوده مجاز
Claude Fable 5
۴۳٪
۲٪
۲٪
GPT-5.6 Sol
۷۱٪
۳۵٪
۱۵٪
اجرای مجدد SDPO اصلی
۹۴٪

مدل GPT-5.6 Sol تنها مدلی بود که پس از اعمال اصلاحات، اندک بهبودی از خود نشان داد. این مدل یک عبارت خودتقلیدی (Self-imitation) به تابع زیان GRPO برای گروه‌هایی که تمام پاسخ‌هایشان با موفقیت همراه بود اضافه کرد. در GRPO استاندارد، این موارد نادیده گرفته می‌شوند چون تمام پاسخ‌ها نتیجه یکسانی دارند و به‌روزرسانی مفیدی انجام نمی‌شود، اما تغییر اعمال‌شده توسط Sol به تقویت سیاست موفق ادامه می‌داد.

البته روش‌های مشابه پیش از این در الگوریتم‌هایی نظیر RAFT++، RL-ZVP و NGRPO مطرح شده بودند؛ به همین دلیل Epoch این راهکار را یک کشف تازه به حساب نیاورد. امتیاز این مدل پس از اصلاح خطای گزارش انتخابی از ۷۱ درصد به ۳۵ درصد سقوط کرد و بعد از حذف تغییراتی که خلاف قوانین بنچمارک تشخیص داده شدند، نهایتاً روی ۱۵ درصد آرام گرفت!

در سمت دیگر، مدل Claude Fable 5 تکنیکی شبیه به STaR توسعه داد که گروه‌های کاملاً ناموفق را بر اساس تلاش‌های قبلی و قضاوت ابزار تاییدکننده، مجدداً نمونه‌برداری می‌کرد. این سازوکار در عمل نتوانست عملکرد را بهتر کند و بهبود ظاهری ۴۳ درصدی آن، پس از اصلاح اعتبارسنجی توسط Epoch، به رقم ناچیز ۲ درصد فروپاشید!

اجراهای گزینشی؛ وقتی آمار و ارقام باد می‌شوند

بزرگ‌ترین شوک آماری ناشی از اجرای مکرر فرایندهای مشابه آموزشی و سپس گزارش کردن بهترین بذر تصادفی (Seed) برای هر مجموعه‌داده بود. این ترفند حتی اگر روش اصلی ذره‌ای پیشرفت نکرده باشد، میانگین امتیاز نهایی را به شکل کاذب بالا می‌برد؛ به ویژه زمانی که برای هر معیار، یک اجرای متفاوت گلچین شود!

گزارش نهایی کلود اگرچه اشاره کوتاهی به چندین بار اجرا برای برخی معیارها داشت، اما هیچ توضیحی درباره ریسک بزرگ‌نمایی نتایج نداده بود و دقیقاً مشخص نکرد کدام نتایج تحت تأثیر این کار قرار گرفته‌اند. در گزارش‌های متنی داخلی این مدل آمده بود که تکرار اجراها راهکاری برای پیدا کردن چک‌پوینت‌های بهتر بوده، چرا که فرایند نهایی ثبت نتایج، بهترین خروجی را برای هر مجموعه‌داده انتخاب می‌کرد.

مدل Sol ماجرا را عجیب‌تر هم کرد؛ این مدل با وجود اینکه قبل از ارسال خروجی، متوجه مشکل انتخاب چندگانه اجراها در فضای کاری خود شده بود، در گزارش نهایی هیچ اشاره‌ای به آن نکرد! به همین دلیل، تیم Epoch این پنهان‌کاری را نشانه‌ای دانست از اینکه ایجنت متوجه نقص روش‌شناختی کارش شده، اما ترجیح داده بدون افشای آن جلو برود.

علاوه بر این، هر دو مدل در گزارش‌هایشان سازوکارهایی را توصیف کرده بودند که در راه‌حل نهایی ارائه‌شده اصلاً فعال نبودند! آن‌ها مدارک چندانی برای اثبات ارتباط اجزای مختلف با اجراهای خاص آموزشی یا بهبودهای حاصله ارائه نکردند. بدون انجام آزمایش‌های حذفی (Ablation study) یا داشتن دفترچه ثبت کامل تمام اجراها، عملاً غیرممکن بود که بفهمیم کدام تغییر روی عملکرد تأثیر واقعی گذاشته است.

دیدن مقاله اصلی کمک کرد، اما مشکل را حل نکرد

تیم پژوهشی Epoch آزمایش را با مدل‌های جدید‌تر GPT-6 Astra و Claude Fable 5.1 که مقاله SDPO در داده‌های آموزشی آن‌ها وجود داشت تکرار کرد. این بررسی موسوم به ارزیابی «آلودگی داده‌ها» (Contamination check) به این منظور انجام شد تا مشخص شود آیا مدل‌ها می‌توانند روشی را که قبلاً در مقالات دیده‌اند، بازآفرینی و پیاده‌سازی کنند یا خیر.

مدل GPT-6 Astra یک سیستم خودتقطیر با ساختار معلم درونی پیاده کرد که شباهت بسیار زیادی به معماری SDPO داشت. جالب اینجاست که این مدل حتی در حین پیاده‌سازی، کدبیس اولیه را برای پیدا کردن ارجاعاتی به SDPO جستجو کرده بود! با این حال، امتیاز آن پس از اصلاحات به ۶۳ درصد رسید.

مدل Claude Fable 5.1 هم تلاش کرد SDPO را پیاده کند، اما پس از چندین آزمایش ناموفق، این روش را به کل کنار گذاشت و به سراغ تنظیم هایپرپارامترها در همان الگوریتم GRPO رفت؛ در نتیجه، امتیاز نهایی و اصلاح‌شده آن روی ۴۰ درصد متوقف شد.

این نتایج تکمیلی نشان می‌دهد که دیدن قبلی مقالات اگرچه عملکرد را بهبود می‌بخشد، اما هرگز تضمینی برای پیاده‌سازی بی‌نقص آن نیست. هر دو مدلی که این مقاله در داده‌های آموزشی‌شان وجود داشت، باز هم با امتیاز مرجع ۹۴ درصدی Epoch فاصله معناداری داشتند.

بنچمارک InnovationEval چه چیزی را ثابت می‌کند؟

ارزیابی‌های فعلی مانند افق‌های زمانی METR و بنچمارک Crux Evals پیشرفت ایجنت‌ها را در وظایف محدود مهندسی و تحقیقاتی می‌سنجند. اما InnovationEval توانایی بسیار ظریف‌تری را محک می‌زند: اینکه آیا یک هوش مصنوعی می‌تواند در آزمایش‌های آزادانه به یک پیشرفت الگوریتمی واقعی دست یابد و در عین حال، اصول علمی ارزیابی و گزارش‌دهی صادقانه را رعایت کند؟

البته این مطالعه اولیه محدودیت‌هایی هم دارد:

  • حجم نمونه‌ها کوچک بوده و برای هر مدل تقریباً یک تلاش عمده ثبت شده است؛ بنابراین نوسانات اجراها می‌تواند روی رتبه‌بندی نهایی تأثیر بگذارد.
  • میزان توان پردازشی ارائه‌شده برای وظایف آموزشی زیاد بود، اما شاید گستردگی کاوش یک تیم تحقیقاتی انسانی را به طور کامل پوشش ندهد.
  • مدل Sol بودجه پردازشی خود را به پایان رساند و بهترین رویکردش را خیلی دیر پیدا کرد؛ این یعنی منابع بیش‌تر شاید می‌توانست نتیجه متفاوتی رقم بزند.
  • به محض ورود مقاله به داده‌های آموزشی مدل‌ها، هدف مخفی کارایی خود را از دست می‌دهد؛ بنابراین Epoch قصد دارد با آمدن مدل‌های تازه‌تر، اهداف آزمایش را مرتباً به‌روزرسانی کند.
  • تیم Epoch کدها و مستندات این تسک را هنوز عمومی منتشر نکرده تا ریسک آلودگی داده‌ها کاهش یابد، هرچند این موضوع بازآفرینی مستقل نتایج را محدود می‌کند.

ایجاد حفاظ‌های امنیتی برای ایجنت‌های محقق

توسعه‌دهندگانی که روی سیستم‌های تحقیقاتی خودمختار کار می‌کنند، می‌توانند از این نقاط ضعف برای تقویت چارچوب‌های ارزیابی خود بهره ببرند. یک پایپ‌لاین معتبر و استاندارد باید تمام آزمایش‌ها را ثبت کند، اجراهای اکتشافی را از ارزیابی‌های نهایی تفکیک کند، جلوی انتخاب گزینشی بذرها برای هر معیار را بگیرد و ایجنت‌ها را موظف کند که هر ادعایی را مستقیماً به اجرای آزمایشیِ مربوط به آن متصل نمایند.

  • ثبت تمامی بذرها (Seeds)، چک‌پوینت‌ها، تغییرات کانفیگ و آزمایش‌های ناموفق.
  • اختصاص یک مجموعه ارزیابی ثابت که ایجنت نتواند مکرراً به آن دست‌اندازی کند یا از آن پرس‌وجو نماید.
  • الزام به انجام آزمایش‌های حذفی (Ablations) قبل از نسبت دادن بهبودها به یک سازوکار تازه.
  • محاسبه میزان عدم قطعیت در میان تمامی اجراها به جای گلچین کردن قوی‌ترین نتیجه.
  • برجسته کردن تناقض‌ها میان تاریخچه فضای کاری ایجنت و گزارش نهایی ارائه‌شده توسط آن.

نخستین یافته‌های بنچمارک InnovationEval شواهد اولیه‌ای از یک تسک بسیار چالش‌برانگیز به دست می‌دهد، اما الگوی مشاهده‌شده در تمام ایجنت‌های تست‌شده کاملاً مشابه است: مدل‌های پیشروی فعلی در خلق یک روش پس‌آموزشِ رقابتی حسابی به زحمت افتادند و گزارش‌های پرزرق‌وبرق آن‌ها نتوانست پنهان کند که دستاوردهای واقعی‌شان پس از بازبینی دقیق علمی، تا چه حد ناچیز بوده است!

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

آواتارهای هوش مصنوعی به تماس‌های تصویری رسیدند؛ شبیه‌سازی ترسناک و مو به تن سیخ‌کن انسان!
آخرین اخبار

آواتارهای هوش مصنوعی به تماس‌های تصویری رسیدند؛ شبیه‌سازی ترسناک و مو به تن سیخ‌کن انسان!

ابزار جدید هوش مصنوعی Griffin با ساخت آواتارهای ویدیویی فوق‌العاده واقع‌گرایانه، تماس‌های تصویری را متحول کرده؛ آواتارهایی که درست مثل یک انسان واقعی حرف می‌زنند، شوخی می‌کنند و واکنش نشان می‌دهند. با این حال، توانایی عجیب این ابزار در شبیه‌سازی انسان باعث شده کارشناسان درباره موج تازه کلاهبرداری‌ها هشدار دهند.

۷ دقیقه مطالعه
۰
۱۶ مهر
ترمز موقت اسپیس‌ایکس در توسعه دیتاسنتر کولوسوس: وقتی پایداری از سرعت مهم‌تر می‌شود!
آخرین اخبار

ترمز موقت اسپیس‌ایکس در توسعه دیتاسنتر کولوسوس: وقتی پایداری از سرعت مهم‌تر می‌شود!

اسپیس‌ایکس پس از قطعی‌های اخیر در دیتاسنتر ممفیس که سرویس گروک و مشتریان پردازشی را مختل کرد، ساختار مدیریتی دیتاسنتر غول‌پیکر کولوسوس را به کلی دگرگون کرده است. این شرکت اکنون با جایگزینی مدیران قبلی با مهندسان باسابقه موشک و استارلینک، سیستم‌های برق پشتیبان و خنک‌کننده اضطراری را ارتقا داده تا پایداری شبکه را فدای رکوردشکنی در سرعت ساخت نکند؛ تصمیمی حیاتی که به دلیل حفظ قراردادهای ماهانه چند میلیارد دلاری با غول‌های فناوری اتخاذ شده است.

۳ دقیقه مطالعه
۰
۱۶ مهر
مدیر ارشد گلدمن ساکس: «نیروهای تازه‌کار از روز اول یک ارتش مجازی از هوش مصنوعی را مدیریت می‌کنند!»
آخرین اخبار

مدیر ارشد گلدمن ساکس: «نیروهای تازه‌کار از روز اول یک ارتش مجازی از هوش مصنوعی را مدیریت می‌کنند!»

کوین اسنیدر، مدیر ارشد گلدمن ساکس، می‌گوید نیروهای تازه‌وارد به جای انجام امور اداری روتین، از همان بدو استخدام مدیریت ارتشی مجازی از هوش مصنوعی را بر عهده می‌گیرند. این تغییر بنیادین الگوهای کاری سنتی را متحول کرده و امنیت شغلی مدیران میانی را به چالش می‌کشد.

۲ دقیقه مطالعه
۰
۱۶ مهر