پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

چالش جذاب تنسنت برای مدل‌های پیشرو: آیا هوش مصنوعی می‌تواند قوانین ناشناخته را با آزمایش کشف کند؟

انتشار:۹ مهر ۱۴۰۵(۲ ساعت پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

محققان شرکت تنسنت با همکاری دانشگاه‌های فودان و تسینگهوا بنچمارک جدیدی به نام ExplorationBench توسعه داده‌اند که توانایی مدل‌های هوش مصنوعی را در کشف قوانین ناشناخته از طریق آزمایش فعال می‌سنجد. این ارزیابی نشان می‌دهد مدل‌ها در صورت داشتن ابزار کاوش و بازخورد محیطی عملکرد بسیار بهتری دارند، هرچند که کشف قوانین همیشه تضمین‌کننده اجرای بی‌نقص آن‌ها در عمل نیست.

چالش جذاب تنسنت برای مدل‌های پیشرو: آیا هوش مصنوعی می‌تواند قوانین ناشناخته را با آزمایش کشف کند؟

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم هونیوان شرکت تنسنت با همکاری دانشگاه‌های فودان و تسینگهوا، بنچمارک جدید ExplorationBench را معرفی کرده‌اند که مدل‌های پیشرو را در دو دنیای شبیه‌سازی‌شده محک می‌زند تا توانایی آن‌ها را در کشف فعالانه قوانین پنهان بسنجد.
  • نتایج آزمون‌ها نشان داد تعامل مستقیم و آزمون‌وخطا عملکرد مدل‌ها را از زیر ۱۶ درصد به مرز ۸۹ درصد می‌رساند؛ در حالی که زمان فکر کردن بیش‌تر بدون ابزار آزمایش، تقریباً هیچ کمکی به یادگیری نمی‌کند.
  • کشف قوانین ناشناخته لزوماً به معنی اجرای درست آن‌ها نیست؛ مدل‌ها حتی وقتی تمام قوانین لازم را به درستی پیدا می‌کنند، باز هم در اجرای عملی گیر دارند و فقط در ۷۳ درصد مواقع مسائل را درست حل می‌کنند.

بنچمارک جدید ExplorationBench که توسط تیم هونیوان (Hunyuan) شرکت تنسنت با همکاری دانشگاه‌های فودان و تسینگهوا توسعه یافته، می‌خواهد ببیند آیا مدل‌های زبانی می‌توانند از طریق آزمایش و کاوش فعالانه، قوانین ناآشنا و جدید را کشف کنند یا خیر. این بنچمارک ۱۰ سیستم پیشروی هوش مصنوعی را در دو محیط شبیه‌سازی‌شده (سندباکس) قرار می‌دهد، از آن‌ها می‌خواهد با کاوش در محیط دست به آزمایش بزنند و سپس عملکردشان را روی مجموعه‌ای از وظایف آزمایشی جداگانه محک می‌زند. جالب اینجاست که ارزیابی کدها و اثبات‌های منطقی توسط برنامه‌های مشخص و قطعی انجام می‌شود تا سلیقه یا قضاوت متغیر داورهای هوش مصنوعی (LLM-as-a-judge) به طور کامل از این چرخه حذف شود.

سینتکس آشنا، اما با قوانینی کاملاً عجیب و بیگانه!

بنچمارک‌هایی که توانایی «کشف» را در مدل‌ها می‌سنجند، همیشه با یک مشکل اعتبارسنجی بزرگ روبه‌رو هستند: مباحث شناخته‌شده و علمی ممکن است قبلاً در داده‌های آموزشی مدل‌ها وجود داشته باشند و تفکیک یادگیری واقعی از آلودگی داده‌ها (Contamination) بسیار دشوار است. از طرف دیگر، مسائل واقعی در مرزهای دانش نیز اغلب راهکار سریع و قطعی برای نمره‌دهی ماشینی ندارند. محققان این پروژه برای دور زدن هر دو چالش، دو دنیای ساختگی ابداع کردند که رفتاری کاملاً خلاف شهود دارند، اما در عین حال خروجی آن‌ها به شکل ۱۰۰ درصد قطعی توسط ماشین قابل بررسی است.

محیط سندباکس
تغییرات پنهان
وظیفه مدل
تأییدکننده
AlienCode
۳۱ قانون تغییریافته در زبان برنامه‌نویسی
استنتاج معنای دستورات و حل مسائل کدنویسی
مفسر (Interpreter)
AlienLogic
۲۴ قانون استنتاج منطقی
ساخت اثبات‌های معتبر یا تشخیص موارد غیرممکن
بررسی‌کننده اثبات (Proof checker)

محیط AlienCode رفتارهای دگرگون‌شده را در قالب ساختار و کدهایی به ظاهر آشنا مخفی کرده است؛ برای مثال، دستور SHATTER به جای معنای ظاهری، عملیات ضرب را انجام می‌دهد، دستور EMIT(100) عدد 127 را چاپ می‌کند (چون تمام اعداد صحیح با عدد ۲۷ عملیات XOR می‌شوند!) و دستور PLUCK با این‌که در راهنمایش ادعا شده اندیس‌گذاری از صفر شروع می‌شود، اما در واقعیت از یک شروع می‌شود. جالب‌تر این‌که در این زبان هیچ عملگر جمعی وجود ندارد و مدل‌ها مجبورند برای پیاده‌سازی عمل جمع، خودشان دست‌به‌کار شوند و آن را با ترکیب سایر عملگرهای دستکاری‌شده بسازند.

از سوی دیگر، محیط AlienLogic قوانین کسر طبیعی (Natural Deduction) را دگرگون کرده است؛ سیستمی رسمی برای اثبات‌های منطقی که در آن هر گام استدلال باید دقیقاً از یک قانون تأییدشده پیروی کند. در این سیستم دستکاری‌شده، حتی برخی از قضایای مطرح‌شده اصلاً اثبات معتبری ندارند؛ بنابراین پاسخ درست از سوی مدل این است که متوجه بن‌بست بشود و تسک را رد کند!

این بنچمارک در مجموع ۵۵ هدف کشف قانون و ۱۴۰ وظیفه ارزیابی را در دو محیط در بر می‌گیرد. مفسر اختصاصی برنامه کدها را به اجرا درمی‌آورد و سیستم بررسی اثبات نیز صحت هر گام منطقی را موشکافانه می‌سنجد.

پروتکل شاخه‌بندی: مهر و مومی برای امنیت آزمون

  1. کاوش در سندباکس: مدل هوش مصنوعی در هر یک از چهار دورِ کاوش، تلاش‌های خود را برای کدنویسی یا اثبات از طریق یک ابزار اختصاصی ارسال می‌کند.
  2. دریافت بازخورد قطعی: محیط بدون توضیح دادن دلیل یا قانون پنهان، فقط نتیجه اجرای دستور را به مدل برمی‌گرداند.
  3. انشعاب گفت‌وگو (Fork): در پایان هر دور، سیستم ارزیابی کپی مکالمه را به یک شاخه ارزیابی مستقل منتقل کرده و دسترسی به ابزار‌ها را در آنجا مسدود می‌کند.
  4. ارزیابی بدون کتاب (Closed-Book): نسخه کپی‌شده مدل، قوانینی را که متوجه شده فهرست می‌کند و به هر وظیفه ارزیابی سه بار پاسخ می‌دهد. سپس سیستم آن شاخه را دور می‌اندازد تا سؤالات آزمون به هیچ وجه روی دورهای بعدی کاوش مدل تأثیر نگذارند.

هر سیستم هوش مصنوعی سه مسیر کاوش مستقل را طی می‌کند. در نهایت بالا‌ترین امتیاز ثبت‌شده در میان این تلاش‌ها با معیار Best@3 گزارش می‌شود؛ زیرا بودجه‌های آزمایشی یکسان می‌توانند به آزمایش‌ها و نتایج کاملاً متفاوتی ختم شوند.

کاوش و آزمون‌وخطا؛ کلید اصلی جهش عملکرد

شرایط آزمون
نتیجه
مشاهده نمونه‌های حل‌شده، پیش از آغاز کاوش
هیچ سیستمی نتوانست از امتیاز ۱۵.۷ درصد بالا‌تر برود
چهار دور کاوش با ابزار‌های سندباکس
بهترین امتیاز به ۸۹.۰ درصد رسید؛ هفت سیستم از ۱۰ سیستم بالای ۶۰ درصد گرفتند
دورهای اضافه بدون در اختیار داشتن ابزار
امتیازها در محدوده ضعیف ۰.۵ تا ۱۱.۰ درصد درجا زدند

بررسی وضعیت «بدون ابزار» ثابت کرد که صرفاً دادن زمان بیش‌تر برای فکر کردن و استنتاج به مدل‌ها، به‌تنهایی کمک خاصی به آن‌ها نکرده است. در محیط AlienLogic حتی سه مدل از ۱۰ سیستم هنگامی که دیگر امکان تعامل با سندباکس را نداشتند، دقت خود را در دورهای بعدی از دست دادند و پسرفت کردند.

آزمایش موسوم به Hindsight نیز مشخص کرد که آیا مدل‌ها صرفاً از دیدن شواهد بهره می‌برند یا خیر. پژوهشگران اقدامات و کاوش‌های بهترین مسیر هر سیستم را برای یک اجرای جدید پخش کردند؛ به این صورت که مدل دوم تمام مشاهدات را دید، اما خودش حق انتخاب آزمایش‌ها را نداشت. جالب است بدانید ۹ مدل از ۱۰ مدل وقتی خودشان آزمایش‌ها را انتخاب و طراحی کردند، عملکرد بسیار بهتری نشان دادند و برتری آن‌ها به طور میانگین ۱۷.۴ درصد بود. این موضوع نشان می‌دهد یک سری داده و شواهد یکسان، اگر بر اساس فرضیه و آزمایش خود مدل به دست نیامده باشد، بسیار کم‌فایده‌تر خواهد بود.

شکاف عمیق میان کشف قانون و اجرای درست آن

  • محدودیت AlienLogic در کشف قانون بود: وقتی قوانین مستقیماً در اختیار مدل‌ها قرار گرفت، امتیاز آن‌ها به ۹۳ تا ۹۷ درصد رسید که فراتر از تمام دفعات کاوش بود.
  • محیط AlienCode ضعف در به‌کارگیری قوانین را آشکار کرد: در ۷ سیستم از ۱۰ سیستم، بهترین مسیر کاوش فعال حتی امتیازی بهتر از حالتی کسب کرد که قوانین از همان ابتدا به صورت آماده به مدل داده شده بود!
  • کاوش باعث درک عمیق‌تر و استفاده بهتر از قوانین شد: در ۲۶ مسیر از ۳۰ مسیرِ AlienCode، وقتی قوانین پس از پایان مرحله کاوش در اختیار مدل قرار گرفت، امتیاز بسیار بهتری نسبت به حالت تحویل پیش از کاوش ثبت شد؛ اختلافی که میانگین جهش آن ۱۴.۵ درصد بود.

با این همه، توصیف درست یک قانون همچنان به معنی اجرای بی‌نقص آن نیست. زمانی که گزارش نهایی یک مدل تمامی قوانین لازم برای حل یک مسئله را در بر داشت، در عمل تنها توانست در ۷۳.۴ درصد مواقع آن مسئله را با موفقیت حل کند!

تفاوت میان دو اجرای مدل کیمی (Kimi K3) این شکاف را به خوبی نمایان می‌کند. هر دو اجرا با بودجه‌ای یکسان، جابه‌جایی اندیس را به درستی تشخیص دادند؛ با این حال، یکی از آن‌ها امتیاز خیره‌کننده ۷۹.۰ درصد را ثبت کرد و دیگری روی ۵.۷ درصد سقوط کرد! علت افت شدید مدل دوم این بود که قانونی را که متعلق به سطح بالای برنامه بود، مدام در داخل بدنه توابع به کار می‌بست؛ جایی که آن قانون دیگر اعتبار نداشت.

یک امتیاز کلی که نوسانات عجیب را مخفی می‌کند

سیستم
پایین‌ترین امتیاز
بالا‌ترین امتیاز
Kimi K3
۵.۷ درصد
۷۹.۰ درصد
Gemini 3.8 Flash
۶.۲ درصد
۷۹.۰ درصد

این اختلاف فاحش در نتایج، رتبه‌بندی مدل‌ها را به نحوه تجمیع داده‌ها به شدت حساس می‌کند. معیار Best@3 اوج پتانسیل مدل را نشان می‌دهد، در حالی که میانگین امتیازها معیاری از ثبات عملکرد است و تغییر بین این دو روش می‌تواند رده‌بندی سیستم‌ها را کاملاً زیرورو کند. علاوه بر این، رتبه‌ها بین دو محیط شباهت چندانی نداشتند: مدل گراک (Grok 4.6) در AlienCode پنجم شد، اما در AlienLogic رتبه اول را درو کرد؛ از سوی دیگر، جمینای (Gemini 3.8 Flash) در AlienCode مشترکاً سوم شد، اما در AlienLogic به قعر جدول سقوط کرد! ضریب همبستگی اسپیرمن در این میان ۰.۳۵ بود که نشان‌دهنده ارتباط ضعیف میان این دو سناریو است.

در بهترین مسیرهای مدل‌ها در AlienCode، بیش‌ترین پیشرفت تنها در یک دور مشخص به دست آمد و همان یک دور مسئول ۴۷ تا ۹۲ درصد از کل رشد امتیاز بود. پسرفت و افت عملکرد هم کم دیده نشد؛ در ۶ مسیر از ۳۰ مسیر AlienCode و ۳ مسیر از ۳۰ مسیر AlienLogic، امتیاز نهایی حداقل ۳ درصد پایین‌تر از دستاوردهای مراحل قبلی ثبت شد.

حتی در یکی از اجراهای Gemini 3.8 Flash، این مدل در دور اول یک قضیه غیرقابل‌اثبات را به درستی رد کرد، اما بعداً یک راه‌حل میانبر من‌درآوردی ارائه داد که توسط سیستم اعتبارسنجی رد شد. با این حال، مدل همین راه‌حل ردشده را در گزارش نهایی‌اش به عنوان یک قانون معتبر ثبت کرد!

درس‌های کلیدی برای توسعه‌دهندگان ایجنت‌ها

  • گزارش توزیع امتیازها به جای یک عدد واحد: میانگین، واریانس و معیارهایی مثل Best@k هم قابلیت اطمینان مدل و هم اوج توانایی آن را مشخص می‌کنند.
  • ارزیابی جداگانه کشف و اجرا: گزارش قوانین نشان می‌دهد مدل چه مواردی را فهمیده است، در حالی که تسک‌های آزمایشی مشخص می‌کنند آیا توانایی پیاده‌سازی همان آموخته‌ها را در عمل دارد یا نه.
  • ذخیره و حفظ چک‌پوینت‌های میانی: کاوش‌های بعدی ممکن است یک فرضیه درست را بازنویسی کرده و آن را با یک تحلیل ضعیف‌تر جایگزین کنند.
  • سنجش مهارت طراحی آزمایش: دادن مشاهدات آماده به مدل، مهارت واقعی یک ایجنت در طراحی آزمون‌های معنادار را کم‌رنگ یا کدر نشان می‌دهد.
  • استفاده از اعتبارسنج‌های قطعی در صورت امکان: مفسرها و سیستم‌های بررسی اثبات منطقی، ارزیابی دقیق، قابل تکرار و فارغ از خطایی در سطح تسک‌ها ارائه می‌دهند.

ارسال مدل‌ها، دسترسی به کد و پرسش‌های بی‌پاسخ

  • مقاله علمی، بلاگ پروژه و لیدربورد رقابت منتشر شده و مخزن گیت‌هاب آن نیز به زودی در دسترس قرار می‌گیرد.
  • برای جلوگیری از آلودگی داده‌های آموزشی مدل‌ها، مجموعه وظایف آزمایشی به صورت محرمانه باقی مانده و پژوهشگران از سایر تیم‌ها دعوت کرده‌اند تا مدل‌های خود را برای ارزیابی با این پروتکل بفرستند.
  • این بنچمارک در حال حاضر یادگیری درون یک نشست (Session) کاری را می‌سنجد. اطلاعات پس از ریست شدن مدل پاک می‌شوند و تثبیت دانش در حافظه بلندمدت یا پارامترهای مدل، همچنان یکی از مسائل باز در دنیای پژوهش هوش مصنوعی است.
  • دو محیط شبیه‌سازی‌شده حاضر، مهارت‌های کاوش را در شرایط کنترل‌شده تفکیک می‌کنند؛ اما چگونگی انتقال این مهارت‌ها به نرم‌افزارهای تجاری، تحقیقات علمی و محیط‌های دنیای واقعی هنوز مورد سنجش قرار نگرفته است.

در مجموع این آزمایش‌ها نشان دادند که کاوش فعالانه می‌تواند جهش بزرگی در عملکرد سیستم‌ها ایجاد کند، اما میزان موفقیت به مسیر آزمایش، محیط و مهارت مدل در پیاده‌سازی قوانین بستگی زیادی دارد. استدلال طولانی‌تر بدون شواهد تازه کمکی به حل مسئله نکرد و حتی مدل‌هایی با گزارش‌های بسیار دقیق از قوانین، در مقام عمل خطاهای اجرایی چشمگیری داشتند. بنچمارک ExplorationBench اکنون ابزاری سنجیده با داوری ماشینی و قطعی را در اختیار توسعه‌دهندگان می‌گذارد تا این توانمندی‌ها را به شکل مجزا و دقیق محک بزنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

خط قرمز کالیفرنیا برای کارفرماها: اخراج کارمندان با هوش مصنوعی رسماً ممنوع شد!
آخرین اخبار

خط قرمز کالیفرنیا برای کارفرماها: اخراج کارمندان با هوش مصنوعی رسماً ممنوع شد!

ایالت کالیفرنیا با تصویب یک بسته قانونی تازه، دست کارفرماها را در استفاده بی‌رویه از هوش مصنوعی بست و اخراج کارکنان صرفاً بر اساس تصمیم الگوریتم‌ها را ممنوع اعلام کرد. این قانون علاوه بر الزام به شفافیت در تعدیل‌های نیرو، استفاده از هوش مصنوعی برای نظارت تصویری در سرویس‌های بهداشتی محل کار را هم قدغن کرده است. فرماندار کالیفرنیا با دفاع از نیروی کار، ادعای امکان خودتنظیم‌گری شرکت‌های هوش مصنوعی را بی‌اساس خواند.

۲ دقیقه مطالعه
۰
۹ مهر
طوفان هوش مصنوعی در بازار حافظه؛ رکورد تاریخی درآمد ۵۴ میلیارد دلاری میکرون در یک فصل!
آخرین اخبار

طوفان هوش مصنوعی در بازار حافظه؛ رکورد تاریخی درآمد ۵۴ میلیارد دلاری میکرون در یک فصل!

عطش سیری‌ناپذیر غول‌های فناوری برای توسعه هوش مصنوعی، درآمد فصلی شرکت میکرون را با جهشی باورنکردنی به بیش از ۵۴ میلیارد دلار رساند تا وال‌استریت شگفت‌زده شود. این غول تراشه‌سازی با ثبت درآمد سالانه ۱۳۳ میلیارد دلاری رکورد تاریخ خود را شکست و حالا با تقاضای انفجاری برای حافظه‌های پیشرفته، چشم به آینده‌ای درخشان‌تر دوخته است.

۲ دقیقه مطالعه
۰
۹ مهر
خداحافظی گوگل با Opal؛ جمزها به «اسکیل‌های جمینای» برای تمام کاربران تبدیل می‌شوند!
آخرین اخبار

خداحافظی گوگل با Opal؛ جمزها به «اسکیل‌های جمینای» برای تمام کاربران تبدیل می‌شوند!

گوگل در اقدامی تازه برای یکپارچه‌سازی ابزار‌های هوش مصنوعی، سرویس Opal را بازنشسته کرده و دستیارهای اختصاصی جمز را به «اسکیل‌های جمینای» تبدیل می‌کند. این قابلیت که پیش از این در انحصار کاربران اشتراکی بود، حالا با پیروی از استاندارد مشترک ایجنت‌ها و به کمک دستورهای ساده اسلش، به رایگان در دسترس همه کاربران قرار می‌گیرد.

۴ دقیقه مطالعه
۰
۹ مهر