چالش جذاب تنسنت برای مدلهای پیشرو: آیا هوش مصنوعی میتواند قوانین ناشناخته را با آزمایش کشف کند؟
محققان شرکت تنسنت با همکاری دانشگاههای فودان و تسینگهوا بنچمارک جدیدی به نام ExplorationBench توسعه دادهاند که توانایی مدلهای هوش مصنوعی را در کشف قوانین ناشناخته از طریق آزمایش فعال میسنجد. این ارزیابی نشان میدهد مدلها در صورت داشتن ابزار کاوش و بازخورد محیطی عملکرد بسیار بهتری دارند، هرچند که کشف قوانین همیشه تضمینکننده اجرای بینقص آنها در عمل نیست.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- تیم هونیوان شرکت تنسنت با همکاری دانشگاههای فودان و تسینگهوا، بنچمارک جدید ExplorationBench را معرفی کردهاند که مدلهای پیشرو را در دو دنیای شبیهسازیشده محک میزند تا توانایی آنها را در کشف فعالانه قوانین پنهان بسنجد.
- نتایج آزمونها نشان داد تعامل مستقیم و آزمونوخطا عملکرد مدلها را از زیر ۱۶ درصد به مرز ۸۹ درصد میرساند؛ در حالی که زمان فکر کردن بیشتر بدون ابزار آزمایش، تقریباً هیچ کمکی به یادگیری نمیکند.
- کشف قوانین ناشناخته لزوماً به معنی اجرای درست آنها نیست؛ مدلها حتی وقتی تمام قوانین لازم را به درستی پیدا میکنند، باز هم در اجرای عملی گیر دارند و فقط در ۷۳ درصد مواقع مسائل را درست حل میکنند.
بنچمارک جدید ExplorationBench که توسط تیم هونیوان (Hunyuan) شرکت تنسنت با همکاری دانشگاههای فودان و تسینگهوا توسعه یافته، میخواهد ببیند آیا مدلهای زبانی میتوانند از طریق آزمایش و کاوش فعالانه، قوانین ناآشنا و جدید را کشف کنند یا خیر. این بنچمارک ۱۰ سیستم پیشروی هوش مصنوعی را در دو محیط شبیهسازیشده (سندباکس) قرار میدهد، از آنها میخواهد با کاوش در محیط دست به آزمایش بزنند و سپس عملکردشان را روی مجموعهای از وظایف آزمایشی جداگانه محک میزند. جالب اینجاست که ارزیابی کدها و اثباتهای منطقی توسط برنامههای مشخص و قطعی انجام میشود تا سلیقه یا قضاوت متغیر داورهای هوش مصنوعی (LLM-as-a-judge) به طور کامل از این چرخه حذف شود.
سینتکس آشنا، اما با قوانینی کاملاً عجیب و بیگانه!
بنچمارکهایی که توانایی «کشف» را در مدلها میسنجند، همیشه با یک مشکل اعتبارسنجی بزرگ روبهرو هستند: مباحث شناختهشده و علمی ممکن است قبلاً در دادههای آموزشی مدلها وجود داشته باشند و تفکیک یادگیری واقعی از آلودگی دادهها (Contamination) بسیار دشوار است. از طرف دیگر، مسائل واقعی در مرزهای دانش نیز اغلب راهکار سریع و قطعی برای نمرهدهی ماشینی ندارند. محققان این پروژه برای دور زدن هر دو چالش، دو دنیای ساختگی ابداع کردند که رفتاری کاملاً خلاف شهود دارند، اما در عین حال خروجی آنها به شکل ۱۰۰ درصد قطعی توسط ماشین قابل بررسی است.
محیط سندباکس | تغییرات پنهان | وظیفه مدل | تأییدکننده |
|---|---|---|---|
AlienCode | ۳۱ قانون تغییریافته در زبان برنامهنویسی | استنتاج معنای دستورات و حل مسائل کدنویسی | مفسر (Interpreter) |
AlienLogic | ۲۴ قانون استنتاج منطقی | ساخت اثباتهای معتبر یا تشخیص موارد غیرممکن | بررسیکننده اثبات (Proof checker) |
محیط AlienCode رفتارهای دگرگونشده را در قالب ساختار و کدهایی به ظاهر آشنا مخفی کرده است؛ برای مثال، دستور SHATTER به جای معنای ظاهری، عملیات ضرب را انجام میدهد، دستور EMIT(100) عدد 127 را چاپ میکند (چون تمام اعداد صحیح با عدد ۲۷ عملیات XOR میشوند!) و دستور PLUCK با اینکه در راهنمایش ادعا شده اندیسگذاری از صفر شروع میشود، اما در واقعیت از یک شروع میشود. جالبتر اینکه در این زبان هیچ عملگر جمعی وجود ندارد و مدلها مجبورند برای پیادهسازی عمل جمع، خودشان دستبهکار شوند و آن را با ترکیب سایر عملگرهای دستکاریشده بسازند.
از سوی دیگر، محیط AlienLogic قوانین کسر طبیعی (Natural Deduction) را دگرگون کرده است؛ سیستمی رسمی برای اثباتهای منطقی که در آن هر گام استدلال باید دقیقاً از یک قانون تأییدشده پیروی کند. در این سیستم دستکاریشده، حتی برخی از قضایای مطرحشده اصلاً اثبات معتبری ندارند؛ بنابراین پاسخ درست از سوی مدل این است که متوجه بنبست بشود و تسک را رد کند!
این بنچمارک در مجموع ۵۵ هدف کشف قانون و ۱۴۰ وظیفه ارزیابی را در دو محیط در بر میگیرد. مفسر اختصاصی برنامه کدها را به اجرا درمیآورد و سیستم بررسی اثبات نیز صحت هر گام منطقی را موشکافانه میسنجد.
پروتکل شاخهبندی: مهر و مومی برای امنیت آزمون
- کاوش در سندباکس: مدل هوش مصنوعی در هر یک از چهار دورِ کاوش، تلاشهای خود را برای کدنویسی یا اثبات از طریق یک ابزار اختصاصی ارسال میکند.
- دریافت بازخورد قطعی: محیط بدون توضیح دادن دلیل یا قانون پنهان، فقط نتیجه اجرای دستور را به مدل برمیگرداند.
- انشعاب گفتوگو (Fork): در پایان هر دور، سیستم ارزیابی کپی مکالمه را به یک شاخه ارزیابی مستقل منتقل کرده و دسترسی به ابزارها را در آنجا مسدود میکند.
- ارزیابی بدون کتاب (Closed-Book): نسخه کپیشده مدل، قوانینی را که متوجه شده فهرست میکند و به هر وظیفه ارزیابی سه بار پاسخ میدهد. سپس سیستم آن شاخه را دور میاندازد تا سؤالات آزمون به هیچ وجه روی دورهای بعدی کاوش مدل تأثیر نگذارند.
هر سیستم هوش مصنوعی سه مسیر کاوش مستقل را طی میکند. در نهایت بالاترین امتیاز ثبتشده در میان این تلاشها با معیار Best@3 گزارش میشود؛ زیرا بودجههای آزمایشی یکسان میتوانند به آزمایشها و نتایج کاملاً متفاوتی ختم شوند.
کاوش و آزمونوخطا؛ کلید اصلی جهش عملکرد
شرایط آزمون | نتیجه |
|---|---|
مشاهده نمونههای حلشده، پیش از آغاز کاوش | هیچ سیستمی نتوانست از امتیاز ۱۵.۷ درصد بالاتر برود |
چهار دور کاوش با ابزارهای سندباکس | بهترین امتیاز به ۸۹.۰ درصد رسید؛ هفت سیستم از ۱۰ سیستم بالای ۶۰ درصد گرفتند |
دورهای اضافه بدون در اختیار داشتن ابزار | امتیازها در محدوده ضعیف ۰.۵ تا ۱۱.۰ درصد درجا زدند |
بررسی وضعیت «بدون ابزار» ثابت کرد که صرفاً دادن زمان بیشتر برای فکر کردن و استنتاج به مدلها، بهتنهایی کمک خاصی به آنها نکرده است. در محیط AlienLogic حتی سه مدل از ۱۰ سیستم هنگامی که دیگر امکان تعامل با سندباکس را نداشتند، دقت خود را در دورهای بعدی از دست دادند و پسرفت کردند.
آزمایش موسوم به Hindsight نیز مشخص کرد که آیا مدلها صرفاً از دیدن شواهد بهره میبرند یا خیر. پژوهشگران اقدامات و کاوشهای بهترین مسیر هر سیستم را برای یک اجرای جدید پخش کردند؛ به این صورت که مدل دوم تمام مشاهدات را دید، اما خودش حق انتخاب آزمایشها را نداشت. جالب است بدانید ۹ مدل از ۱۰ مدل وقتی خودشان آزمایشها را انتخاب و طراحی کردند، عملکرد بسیار بهتری نشان دادند و برتری آنها به طور میانگین ۱۷.۴ درصد بود. این موضوع نشان میدهد یک سری داده و شواهد یکسان، اگر بر اساس فرضیه و آزمایش خود مدل به دست نیامده باشد، بسیار کمفایدهتر خواهد بود.
شکاف عمیق میان کشف قانون و اجرای درست آن
- محدودیت AlienLogic در کشف قانون بود: وقتی قوانین مستقیماً در اختیار مدلها قرار گرفت، امتیاز آنها به ۹۳ تا ۹۷ درصد رسید که فراتر از تمام دفعات کاوش بود.
- محیط AlienCode ضعف در بهکارگیری قوانین را آشکار کرد: در ۷ سیستم از ۱۰ سیستم، بهترین مسیر کاوش فعال حتی امتیازی بهتر از حالتی کسب کرد که قوانین از همان ابتدا به صورت آماده به مدل داده شده بود!
- کاوش باعث درک عمیقتر و استفاده بهتر از قوانین شد: در ۲۶ مسیر از ۳۰ مسیرِ AlienCode، وقتی قوانین پس از پایان مرحله کاوش در اختیار مدل قرار گرفت، امتیاز بسیار بهتری نسبت به حالت تحویل پیش از کاوش ثبت شد؛ اختلافی که میانگین جهش آن ۱۴.۵ درصد بود.
با این همه، توصیف درست یک قانون همچنان به معنی اجرای بینقص آن نیست. زمانی که گزارش نهایی یک مدل تمامی قوانین لازم برای حل یک مسئله را در بر داشت، در عمل تنها توانست در ۷۳.۴ درصد مواقع آن مسئله را با موفقیت حل کند!
تفاوت میان دو اجرای مدل کیمی (Kimi K3) این شکاف را به خوبی نمایان میکند. هر دو اجرا با بودجهای یکسان، جابهجایی اندیس را به درستی تشخیص دادند؛ با این حال، یکی از آنها امتیاز خیرهکننده ۷۹.۰ درصد را ثبت کرد و دیگری روی ۵.۷ درصد سقوط کرد! علت افت شدید مدل دوم این بود که قانونی را که متعلق به سطح بالای برنامه بود، مدام در داخل بدنه توابع به کار میبست؛ جایی که آن قانون دیگر اعتبار نداشت.
یک امتیاز کلی که نوسانات عجیب را مخفی میکند
سیستم | پایینترین امتیاز | بالاترین امتیاز |
|---|---|---|
Kimi K3 | ۵.۷ درصد | ۷۹.۰ درصد |
Gemini 3.8 Flash | ۶.۲ درصد | ۷۹.۰ درصد |
این اختلاف فاحش در نتایج، رتبهبندی مدلها را به نحوه تجمیع دادهها به شدت حساس میکند. معیار Best@3 اوج پتانسیل مدل را نشان میدهد، در حالی که میانگین امتیازها معیاری از ثبات عملکرد است و تغییر بین این دو روش میتواند ردهبندی سیستمها را کاملاً زیرورو کند. علاوه بر این، رتبهها بین دو محیط شباهت چندانی نداشتند: مدل گراک (Grok 4.6) در AlienCode پنجم شد، اما در AlienLogic رتبه اول را درو کرد؛ از سوی دیگر، جمینای (Gemini 3.8 Flash) در AlienCode مشترکاً سوم شد، اما در AlienLogic به قعر جدول سقوط کرد! ضریب همبستگی اسپیرمن در این میان ۰.۳۵ بود که نشاندهنده ارتباط ضعیف میان این دو سناریو است.
در بهترین مسیرهای مدلها در AlienCode، بیشترین پیشرفت تنها در یک دور مشخص به دست آمد و همان یک دور مسئول ۴۷ تا ۹۲ درصد از کل رشد امتیاز بود. پسرفت و افت عملکرد هم کم دیده نشد؛ در ۶ مسیر از ۳۰ مسیر AlienCode و ۳ مسیر از ۳۰ مسیر AlienLogic، امتیاز نهایی حداقل ۳ درصد پایینتر از دستاوردهای مراحل قبلی ثبت شد.
حتی در یکی از اجراهای Gemini 3.8 Flash، این مدل در دور اول یک قضیه غیرقابلاثبات را به درستی رد کرد، اما بعداً یک راهحل میانبر مندرآوردی ارائه داد که توسط سیستم اعتبارسنجی رد شد. با این حال، مدل همین راهحل ردشده را در گزارش نهاییاش به عنوان یک قانون معتبر ثبت کرد!
درسهای کلیدی برای توسعهدهندگان ایجنتها
- گزارش توزیع امتیازها به جای یک عدد واحد: میانگین، واریانس و معیارهایی مثل Best@k هم قابلیت اطمینان مدل و هم اوج توانایی آن را مشخص میکنند.
- ارزیابی جداگانه کشف و اجرا: گزارش قوانین نشان میدهد مدل چه مواردی را فهمیده است، در حالی که تسکهای آزمایشی مشخص میکنند آیا توانایی پیادهسازی همان آموختهها را در عمل دارد یا نه.
- ذخیره و حفظ چکپوینتهای میانی: کاوشهای بعدی ممکن است یک فرضیه درست را بازنویسی کرده و آن را با یک تحلیل ضعیفتر جایگزین کنند.
- سنجش مهارت طراحی آزمایش: دادن مشاهدات آماده به مدل، مهارت واقعی یک ایجنت در طراحی آزمونهای معنادار را کمرنگ یا کدر نشان میدهد.
- استفاده از اعتبارسنجهای قطعی در صورت امکان: مفسرها و سیستمهای بررسی اثبات منطقی، ارزیابی دقیق، قابل تکرار و فارغ از خطایی در سطح تسکها ارائه میدهند.
ارسال مدلها، دسترسی به کد و پرسشهای بیپاسخ
- مقاله علمی، بلاگ پروژه و لیدربورد رقابت منتشر شده و مخزن گیتهاب آن نیز به زودی در دسترس قرار میگیرد.
- برای جلوگیری از آلودگی دادههای آموزشی مدلها، مجموعه وظایف آزمایشی به صورت محرمانه باقی مانده و پژوهشگران از سایر تیمها دعوت کردهاند تا مدلهای خود را برای ارزیابی با این پروتکل بفرستند.
- این بنچمارک در حال حاضر یادگیری درون یک نشست (Session) کاری را میسنجد. اطلاعات پس از ریست شدن مدل پاک میشوند و تثبیت دانش در حافظه بلندمدت یا پارامترهای مدل، همچنان یکی از مسائل باز در دنیای پژوهش هوش مصنوعی است.
- دو محیط شبیهسازیشده حاضر، مهارتهای کاوش را در شرایط کنترلشده تفکیک میکنند؛ اما چگونگی انتقال این مهارتها به نرمافزارهای تجاری، تحقیقات علمی و محیطهای دنیای واقعی هنوز مورد سنجش قرار نگرفته است.
در مجموع این آزمایشها نشان دادند که کاوش فعالانه میتواند جهش بزرگی در عملکرد سیستمها ایجاد کند، اما میزان موفقیت به مسیر آزمایش، محیط و مهارت مدل در پیادهسازی قوانین بستگی زیادی دارد. استدلال طولانیتر بدون شواهد تازه کمکی به حل مسئله نکرد و حتی مدلهایی با گزارشهای بسیار دقیق از قوانین، در مقام عمل خطاهای اجرایی چشمگیری داشتند. بنچمارک ExplorationBench اکنون ابزاری سنجیده با داوری ماشینی و قطعی را در اختیار توسعهدهندگان میگذارد تا این توانمندیها را به شکل مجزا و دقیق محک بزنند.
مطالب مرتبط و پیشنهادی

خط قرمز کالیفرنیا برای کارفرماها: اخراج کارمندان با هوش مصنوعی رسماً ممنوع شد!
ایالت کالیفرنیا با تصویب یک بسته قانونی تازه، دست کارفرماها را در استفاده بیرویه از هوش مصنوعی بست و اخراج کارکنان صرفاً بر اساس تصمیم الگوریتمها را ممنوع اعلام کرد. این قانون علاوه بر الزام به شفافیت در تعدیلهای نیرو، استفاده از هوش مصنوعی برای نظارت تصویری در سرویسهای بهداشتی محل کار را هم قدغن کرده است. فرماندار کالیفرنیا با دفاع از نیروی کار، ادعای امکان خودتنظیمگری شرکتهای هوش مصنوعی را بیاساس خواند.

طوفان هوش مصنوعی در بازار حافظه؛ رکورد تاریخی درآمد ۵۴ میلیارد دلاری میکرون در یک فصل!
عطش سیریناپذیر غولهای فناوری برای توسعه هوش مصنوعی، درآمد فصلی شرکت میکرون را با جهشی باورنکردنی به بیش از ۵۴ میلیارد دلار رساند تا والاستریت شگفتزده شود. این غول تراشهسازی با ثبت درآمد سالانه ۱۳۳ میلیارد دلاری رکورد تاریخ خود را شکست و حالا با تقاضای انفجاری برای حافظههای پیشرفته، چشم به آیندهای درخشانتر دوخته است.

خداحافظی گوگل با Opal؛ جمزها به «اسکیلهای جمینای» برای تمام کاربران تبدیل میشوند!
گوگل در اقدامی تازه برای یکپارچهسازی ابزارهای هوش مصنوعی، سرویس Opal را بازنشسته کرده و دستیارهای اختصاصی جمز را به «اسکیلهای جمینای» تبدیل میکند. این قابلیت که پیش از این در انحصار کاربران اشتراکی بود، حالا با پیروی از استاندارد مشترک ایجنتها و به کمک دستورهای ساده اسلش، به رایگان در دسترس همه کاربران قرار میگیرد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.