پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

نسخه پنجم شاخص هوش مصنوعی آرتیفیشل آنالیسیس در راه است؛ تست‌های محرمانه کدنویسی برای مچ‌گیری از مدل‌ها!

انتشار:۱۷ مهر ۱۴۰۵(۵۵ دقیقه پیش)
۳ دقیقه زمان مطالعه
۰ دیدگاه

پلتفرم ارزیابی آرتیفیشل آنالیسیس از نسخه پنجم شاخص معروف خود (Intelligence Index v5) رونمایی می‌کند که بزرگ‌ترین بازنگری این بنچمارک در سال جاری به شمار می‌رود. در این نسخه با اضافه شدن بنچمارک علمی ترمینال و آزمون‌های محرمانه کدنویسی، رتبه‌بندی مدل‌های برتر هوش مصنوعی حسابی دگرگون خواهد شد.

نسخه پنجم شاخص هوش مصنوعی آرتیفیشل آنالیسیس در راه است؛ تست‌های محرمانه کدنویسی برای مچ‌گیری از مدل‌ها!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • نسخه پنجم بنچمارک جامع اینتلیجنس ایندکس (Intelligence Index v5) اواخر اکتبر با آزمون‌های سخت‌گیرانه‌تر منتشر می‌شود و می‌تواند رده‌بندی فعلی مدل‌های برتر هوش مصنوعی را حسابی به هم بریزد.
  • این نسخه شامل بنچمارک Terminal-Bench Science با ۷۰ تسک پژوهشی در محیط خط فرمان و یک بنچمارک کدنویسی با تست‌های محرمانه و منتشرنشده است تا مانع نشت داده‌ها در مرحله آموزش مدل‌ها شود.
  • در ارزیابی‌های اولیه این بنچمارک علمی، حتی قدرتمندترین مدل‌ها هم نتوانسته‌اند به مرز موفقیت ۶۴ درصدی برسند که نشان می‌دهد ایجنت‌های هوش مصنوعی هنوز فاصله زیادی تا اجرای بی‌نقص وظایف پیچیده دارند.

پلتفرم ارزیابی مستقل آرتیفیشل آنالیسیس (Artificial Analysis) قصد دارد در اواخر ماه اکتبر از نسخه پنجم شاخص هوش خود تحت عنوان «Intelligence Index v5» پرده بردارد؛ آپدیتی که بزرگ‌ترین بازنگری این بنچمارک ترکیبی در سال جاری محسوب می‌شود. در این به‌روزرسانی مهم، بنچمارک علمی «Terminal-Bench Science» و یک بنچمارک اختصاصی کدنویسی اضافه خواهد شد که مجموعه داده‌های آزمایشی آن کاملاً محرمانه می‌ماند و هرگز منتشر نخواهد شد.

شاخص Intelligence Index نتایج چندین ارزیابی گوناگون را جمع‌بندی کرده و در قالب یک امتیاز واحد برای نشان دادن توانمندی مدل‌ها ارائه می‌دهد. جالب اینکه پژوهشگران در حال حاضر در مقاله‌های پژوهشی مدل‌های شخص ثالث به این شاخص استناد می‌کنند؛ به همین دلیل تغییر بنچمارک‌های آن می‌تواند جدول رده‌بندی مدل‌ها را زیر و رو کند و امکان مقایسه مستقیم نتایج جدید با گذشته را از بین ببرد.

نسخه ۵ دو معیار سخت‌گیرانه‌تر را اضافه می‌کند

تیم آرتیفیشل آنالیسیس این تغییرات را به صورت مرحله‌ای اعمال کرده است. بیلد فعلی یعنی نسخه ۴.۳.۲ شامل بنچمارک‌های مختلفی مثل AA-Briefcase v1.1، GDPval-AA v2.1، AutomationBench-AA، Terminal-Bench 4.0، SciCode، آزمون Humanity's Last Exam، GDP.pdf، CritPt، AA-Omniscience و AA-LCR v1.1 است.

دسته‌بندی
وزن فعلی
ایجنت‌ها (Agents)
۳۰٪
کدنویسی (Coding)
۲۰٪
عمومی (General)
۳۰٪
استدلال علمی (Scientific reasoning)
۲۰٪

نسخه پنجم قرار است بخش‌های زیر را به این ترکیب اضافه کند:

  • ترمینال بنچ ساینس (Terminal-Bench Science): یک آزمون ارزیابی مستقل که توسط پژوهشگران دانشگاه استنفورد به همراه تیم Terminal-Bench و Harbor و با مشارکت دانشمندانی از سراسر جهان توسعه یافته است. تسک‌های این بنچمارک در واقع فرآیندهای واقعی پژوهشی را در محیط خط فرمان شبیه‌سازی می‌کنند.
  • یک بنچمارک محرمانه کدنویسی: ارزیابی جدیدی که بر پایه داده‌های تستی منتشرنشده ساخته شده است. آرتیفیشل آنالیسیس هنوز جزییات تسک‌ها، شیوه نمره‌دهی یا ترکیب دیتاست آن را فاش نکرده است.

همچنین این مجموعه هنوز وزن نهایی هر دسته‌بندی در نسخه پنجم، تاریخ دقیق انتشار و راهنمای مقایسه نمرات نسخه ۵ با نسخه ۴.۳.۲ را اعلام نکرده است. انتظار می‌رود این جزییات هم‌زمان با انتشار لاگ تغییرات (Changelog) رسمی اعلام شوند.

ورود تسک‌های علمی به شاخص هوش

بنچمارک Terminal-Bench Science می‌سنجد که آیا یک ایجنت هوش مصنوعی می‌تواند با استفاده از شل (محیط ترمینال)، فرآیندهای علمی و واقعی پژوهشی را با موفقیت جلو ببرد یا نه. این آزمون شامل ۷۰ تسک در پنج حوزه مختلف است و هر تسک سه بار اجرا می‌شود. نتایج با معیار pass@1 ثبت می‌شوند؛ یعنی تنها در صورتی یک تلاش موفق به حساب می‌آید که تمام تست‌ها با موفقیت پاس شوند و اگر اعتبارسنج (Verifier) با تایم‌اوت مواجه شود، شکست تلقی خواهد شد.

لیدربورد فعلی و مستقل این بنچمارک به خوبی نشان می‌دهد که این آزمون تا چه اندازه دشوار و بی‌رحم است:

  1. مدل GPT-6 Astra (نسخه Max): ۶۳.۳٪
  2. مدل Claude Opus 5.5 (نسخه Xhigh با Default Fallback): ۶۱.۹٪
  3. مدل Claude Opus 5.5 (نسخه Max با Default Fallback): ۵۹.۰٪
  4. مدل Claude Sonnet 5.5: ۵۳.۰٪

هیچ‌کدام از سیستم‌های موجود در لیست نتوانسته‌اند به امتیاز ۶۴ درصد برسند؛ رقمی که نشان می‌دهد ایجنت‌های فعلی هنوز فاصله زیادی تا قابلیت اطمینان صددرصدی در انجام وظایف دارند. اضافه شدن این بنچمارک می‌تواند جدول رده‌بندی کلی را به نفع مدل‌هایی تغییر دهد که در نشست‌های طولانی‌مدت ترمینال دوام می‌آورند، پس از خطاهای حین اجرا خودشان را بازیابی می‌کنند و از پس مراحل چندگانه تحقیقاتی برمی‌آیند.

تست‌های محرمانه؛ راهکاری برای جلوگیری از نشت داده‌های آموزشی

وقتی سؤالات بنچمارک‌های عمومی در سطح اینترنت دست‌به‌دست می‌شوند، این احتمال وجود دارد که وارد داده‌های آموزشی مدل‌ها شوند. در این حالت، مدل هوش مصنوعی به جای اینکه قدرت حل مسائل ندیده‌شده و جدید را نشان دهد، صرفاً راه‌حل‌های حفظی و آشنا را بازتولید می‌کند؛ اتفاقی که ارزش و اعتبار بنچمارک را به عنوان معیاری برای سنجش مهارت واقعی کدنویسی زیر سؤال می‌برد.

آرتیفیشل آنالیسیس برای کاهش این ریسک، بیش از پیش به سراغ نسخه‌های تستی محرمانه و فیلترینگ‌های دقیق رفته است؛ درست همان رویکردی که در بنچمارک AutomationBench-AA در پیش گرفت. بنچمارک جدید کدنویسی هم همین مسیر را ادامه می‌دهد. داده‌های منتشرنشده این آزمون می‌توانند ارزیابی دقیق‌تر و پاک‌تری ارائه دهند، هرچند تیم‌های بیرونی دیگر نمی‌توانند کل ارزیابی را به شکل مستقل بازتولید کرده یا توزیع داده‌های آزمون را بررسی کنند.

برای تغییر ناگهانی نمرات آماده باشید

  1. مقایسه‌های داخلی را پس از انتشار مجدداً اجرا کنید: نمرات نسخه ۴.۳.۲ و نسخه ۵ باید به عنوان دو سری کاملاً جداگانه در نظر گرفته شوند تا زمانی که آرتیفیشل آنالیسیس وزن‌ها و متدولوژی جدید را به طور رسمی منتشر کند.
  2. خط مبنای ایجنت‌های کدنویسی را به‌روزرسانی کنید: نسخه Terminal-Bench 4.0 پیش از این جایگزین نسخه ۲.۱ شده و با مجموعه‌ای سخت‌تر شامل ۶۶ تسک، بازنگری در سقف پردازش و زمان، و محیط‌ها و اعتبارسنج‌های جدید همراه شده است؛ بنابراین با کوچ تیم‌ها از فریم‌ورک‌های قدیمی، احتمال افت نمرات وجود دارد.
  3. شکست‌های ایجنت در تسک‌های علمی را دقیق زیر نظر بگیرید: نمرات تجمیعی گاهی پنهان می‌کنند که آیا ایجنت در بخش برنامه‌ریزی، کار با شل، مدیریت وابستگی‌ها، محاسبات یا اعتبارسنجی شکست خورده است. این تفاوت‌ها برای ارتقا و بهبود ایجنت‌های پژوهشی نقشی حیاتی دارند.
  4. نسخه بنچمارک را دقیق ثبت کنید: گزارش‌ها باید همیشه نسخه دقیق شاخص هوش (Intelligence Index)، پیکربندی مدل و تاریخ ارزیابی را مشخص کنند تا نتایج بعدی در طول زمان قابل تحلیل و تفسیر باقی بمانند.

آرتیفیشل آنالیسیس شیوه‌های امتیازدهی و استانداردهای ارزیابی فعلی خود را در صفحه متدولوژی بنچمارک مستند کرده است. انتظار می‌رود گزارش تغییرات نسخه ۵ تکلیف وزن‌های نهایی، طراحی بنچمارک محرمانه کدنویسی و قوانین مقایسه نتایج میان نسخه‌های مختلف این شاخص را به طور شفاف مشخص کند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد
آخرین اخبار

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد

یک اخترفیزیک‌دان در دانشگاه جانز هاپکینز با استفاده از پلتفرم Claude Science موفق شد یک‌سوم گمشده از نقشه فرابنفش کیهان را بازسازی و کامل کند. این پروژه عظیم که در گذشته به ماه‌ها کار طاقت‌فرسا نیاز داشت، حالا به لطف ایجنت‌های هوشمند کلود و در عرض چند روز به سرانجام رسیده است.

۵ دقیقه مطالعه
۰
۱۷ مهر
سرمایه‌گذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانه‌های هوش مصنوعی شد!
آخرین اخبار

سرمایه‌گذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانه‌های هوش مصنوعی شد!

انویدیا از اختصاص یک میلیارد دلار برای توسعه پژوهش‌های علمی و ابررایانه‌های هوش مصنوعی در آمریکا خبر داد؛ بودجه‌ای که برای این غول تراشه‌ساز حکم پول خرد را دارد اما ارتش پردازشی این کشور را در رقابت با چین تقویت می‌کند. این طرح بلندپروازانه با تجهیز آزمایشگاه‌های ملی به تراشه‌های بلک‌ول، پیشتازی هوش مصنوعی و محاسبات کوانتومی را هدف گرفته است.

۳ دقیقه مطالعه
۰
۱۷ مهر
تاکسی خودران اختصاصی ایکس‌پنگ به خیابان‌ها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تست‌های عمومی
آخرین اخبار

تاکسی خودران اختصاصی ایکس‌پنگ به خیابان‌ها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تست‌های عمومی

شرکت چینی ایکس‌پنگ (XPENG) با معرفی برند جهانی «XPENG YOYO» رسماً وارد فاز آزمایش عمومی تاکسی‌های خودران خود شد. این روبوتاکسی تمام‌عیار با تکیه بر ۴ تراشه هوش مصنوعی تورینگ و مدل پیشرفته بینایی-زبانی VLA 2.0، بدون نیاز به لیدار در خیابان‌ها مسافرگیری می‌کند. کاربران منتخب در چین از همین حالا می‌توانند با کدهای دعوت اختصاصی، سفر در کابین لوکس و هوشمند این تاکسی را تجربه کنند.

۱ دقیقه مطالعه
۰
۱۷ مهر