پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

چالش نفس‌گیر دانشمندان استنفورد برای ایجنت‌ها؛ پیشتازی GPT-6 Astra و کلود در پژوهش‌های واقعی علمی!

انتشار:۱۳ مهر ۱۴۰۵(۲ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

پژوهشگران دانشگاه استنفورد بنچمارک جدیدی به نام Terminal-Bench-Science طراحی کرده‌اند تا عملکرد ایجنت‌های پیشرفته هوش مصنوعی را در حل مسائل واقعی و چندمرحله‌ای علوم پایه بسنجند. نتایج نسخه اولیه نشان می‌دهد که فقط غول‌های هوش مصنوعی مثل GPT-6 Astra و کلود Opus 5.5 توانسته‌اند از پس بیش از نیمی از این مأموریت‌های پیچیده برآیند و مدل‌های متن‌باز هنوز راه درازی تا خودکارسازی کامل پژوهش‌های علمی در پیش دارند.

چالش نفس‌گیر دانشمندان استنفورد برای ایجنت‌ها؛ پیشتازی GPT-6 Astra و کلود در پژوهش‌های واقعی علمی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • محققان دانشگاه استنفورد با همکاری تیم‌های Terminal-Bench و Harbor از بنچمارک جدیدی به نام Terminal-Bench-Science رونمایی کردند که توانایی ایجنت‌های هوش مصنوعی را در محیط واقعی ترمینال و با ۷۰ تسک فوق‌العاده پیچیده علمی به چالش می‌کشد.
  • در این ماراتن علمی، مدل‌های پرچمدار GPT-6 Astra با نرخ موفقیت ۶۳.۳ درصدی و کلود Opus 5.5 با ۶۱.۹ درصد پیشتاز شدند، اما مدل‌های متن‌باز مثل DeepSeek و GLM با اختلافی فاحش و کسب امتیاز زیر ۱۲ درصد کاملاً عقب ماندند.
  • نتایج نشان می‌دهد صرف هزینه سنگین‌تر و زمان استدلال بیش‌تر همیشه به خروجی بهتر ختم نمی‌شود؛ برای نمونه کلود Opus 5.5 در بالا‌ترین سطح تلاش و پردازش نسبت به حالت استدلال فوق‌العاده، امتیاز کمتری ثبت کرده است!

یک بنچمارک جدید و تخصصی برای سنجش ایجنت‌ها، مدل‌های پیشرو هوش مصنوعی را وارد دنیای واقعی و پرپیچ‌وخم پژوهش‌های علمی کرده است؛ جایی که هوش مصنوعی باید با داده‌های خام و ابزار‌های واقعی دست‌وپنجه نرم کند. لیدربورد این ارزیابی نشان می‌دهد که در حال حاضر فقط دو مدل مدعی، یعنی GPT-6 Astra و Claude Opus 5.5، توانسته‌اند به امتیازی بالا‌تر از ۵۰ درصد دست پیدا کنند؛ واقعیتی که اثبات می‌کند خودکارسازی تمام‌عیار فرایندهای پژوهشی هنوز راه درازی در پیش دارد.

مدل GPT-6 Astra در بالا‌ترین سطح استدلال و تلاش محاسباتی (Max Effort) با ثبت نرخ موفقیت ۶۳.۳ درصدی در صدر جدول ایستاده است. در جایگاه بعدی، Claude Opus 5.5 در حالت تلاش فوق‌العاده (xhigh) به موفقیت ۶۱.۹ درصدی و در حالت تلاش حداکثری به ۵۹.۰ درصد رسیده است. در این میان، قدرتمندترین مدل‌های متن‌باز (Open-weight) با نتایجی ناامیدکننده، در حوالی ۱۰ درصد درجا می‌زنند.

هفتاد تسک چالش‌برانگیز و نمره‌دهی بی‌رحمانه «همه یا هیچ»

بنچمارک Terminal-Bench-Science حاصل یک همکاری دانشگاهی و متن‌باز به رهبری پژوهشگران دانشگاه استنفورد، تیم‌های Terminal-Bench و Harbor و دانشمندانی از مؤسسات علمی سراسر جهان است. نسخه ۰.۱.۰ این پروژه شامل ۷۰ تسک منتخب در پنج حوزه علمی گوناگون است:

  • ۱۹ تسک در علوم زیستی
  • ۱۷ تسک در علوم فیزیکی
  • ۱۷ تسک در علوم ریاضی
  • ۹ تسک در علوم مهندسی
  • ۸ تسک در علوم زمین

در هر مأموریت، ایجنت در یک ترمینال ایزوله (Sandbox) قرار می‌گیرد که دستورالعمل‌ها، داده‌ها و نرم‌افزارهای موردنیاز در آن فراهم شده است. سپس سیستم ارزیابی مبتنی بر فریم‌ورک Pytest خروجی‌ها و محاسبات نهایی را موشکافی می‌کند و جالب اینکه یک تسک تنها زمانی «قبول» در نظر گرفته می‌شود که تمام تست‌های آن بدون حتی یک خطا با موفقیت پاس شوند!

نمره‌دهی بر پایه معیار pass@1 انجام می‌شود؛ یعنی ایجنت برای هر اجرا تنها یک شانس دارد و نتیجه نهایی میانگین سه اجرای مستقل برای هر تسک است. همچنین تمام مدل‌ها در چارچوب مشترک mini-swe-agent اجرا می‌شوند تا تأثیر ساختارهای متفرقه ایجنت به حداقل برسد و مقایسه توانایی استدلال مدل‌ها در شرایطی کاملاً عادلانه و یکسان انجام گیرد.

این جریان‌های کاری نیازمند آن هستند که ایجنت‌ها مهارت‌های پردازش داده، استدلال علمی، کار با ابزار‌ها و اعتبارسنجی خروجی‌ها را ترکیب کنند. برای درک بهتر سطح سختی ماجرا، به این چند نمونه واقعی نگاهی بیندازید:

  • بازسازی دقیق تاریخ‌های یخ‌زدن و ذوب‌شدن دریاچه‌ها طی ۱۰ زمستان پیاپی بر اساس تصاویر خام ماهواره‌ای، به همراه پیاده‌سازی معیارهای ترکیبی پوشش یخ.
  • ردیابی تک‌تک تقسیم‌های سلولی در یک ویدیوی میکروسکوپی ۸۰۰ فریمی از مایوبلاست‌های موش و سپس برچسب‌گذاری نسل‌ها و سرنوشت هر سلول (مثل تقسیم، مرگ، ادغام یا خروج از کادر دید).
  • محاسبه بردار حالت زمین‌مرکزی (Geocentric State Vector) برای یک سیارک ناشناخته نزدیک به زمین با استفاده از داده‌های نجومی خام مرکز ریزسیاره‌ها، افمریس‌های JPL ناسا و متادیتای رصدخانه‌ها، با دقت خطای باورنکردنی در مقیاس کیلومتر!

هر ایجنت برای اتمام هر اجرا می‌تواند تا ۲۸٬۸۰۰ ثانیه (یعنی ۸ ساعت تمام) زمان صرف کند، اما طبق قوانین، جستجو برای یافتن پاسخ‌های آماده یا کدهای آنلاین به کلی ممنوع است.

افزایش توان استنتاج؛ کمکی بزرگ اما نامتعادل!

نتایج در حوزه‌های مختلف تفاوت‌های چشمگیری دارد، هرچند طراحان بنچمارک هشدار می‌دهند که تعداد تسک‌ها (بین ۸ تا ۱۹ مورد در هر رشته) ممکن است درصدی از خطا یا نویز در مقایسه‌ها ایجاد کند. علوم زیستی پاشنه آشیل بیش‌تر مدل‌های برتر بوده است؛ برای مثال، Claude Opus 5.5 در بالا‌ترین سطح استدلال توانسته ۷۱ درصد از تسک‌های ریاضی را حل کند، اما در علوم زیستی به ۴۶ درصد بسنده کرده است.

اختصاص بودجه محاسباتی و زمان بیش‌تر برای تفکر و استدلال، در برخی سناریوها جهش چشمگیری ایجاد کرده است. عملکرد Claude Opus 5.5 از حدود ۲۴ درصد در حالت تفکر حداقلی (Low Effort) به ۶۱.۹ درصد در حالت تلاش فوق‌العاده رسیده، اما هزینه اجرای هر تسک تقریباً ۵ برابر شده است. در سوی دیگر، مدل GPT-6 Sol با پرش ۲۷ درصدی از کم‌ترین به بیش‌ترین تلاش، هزینه‌ای در حدود ۷.۵ برابر را به کاربر تحمیل می‌کند!

نکته جالب اینجاست که تزریق توان محاسباتی بیش‌تر همیشه هم معجزه نمی‌کند! Claude Opus 5.5 در حداکثر تلاش محاسباتی (Max Effort) امتیاز ۵۹.۰ درصد را ثبت کرده که ۲.۹ درصد پایین‌تر از حالت xhigh است. این یافته مهم به توسعه‌دهندگان گوشزد می‌کند که به جای فرض ساده‌لوحانه «بودجه بیش‌تر یعنی عملکرد بهتر»، باید نقطه بهینه میان دقت و هزینه را بسنجند.

عقب‌ماندگی ۵۰ درصدی مدل‌های متن‌باز

مدل
سطح تلاش (Effort)
نرخ موفقیت
GPT-6 Astra
Max
۶۳.۳٪
Claude Opus 5.5
Xhigh
۶۱.۹٪
Claude Opus 5.5
Max
۵۹.۰٪
Qwen3.8 Max
نامشخص
۱۲٪
GLM-5.3
Max
۱۰٪
DeepSeek V4.1 Flash
Max
۹٪

مدل‌های GLM-5.3 و DeepSeek V4.1 Flash به عنوان سرشناس‌ترین گزینه‌های متن‌باز در این ارزیابی، بیش از ۵۰ درصد پایین‌تر از GPT-6 Astra ایستاده‌اند. در میان مدل‌های بسته خارج از اکوسیستم OpenAI و Anthropic، مدل Qwen3.8 Max با ثبت ۱۲ درصد بهترین عملکرد را داشته و مدل Fable 5.1 نیز حدود ۲۰ درصد از دو پیشتاز اصلی عقب افتاده است.

چرا آزمایشگاه‌های بزرگ هوش مصنوعی به این بنچمارک روی آورده‌اند؟

بسیاری از آزمون‌های متداول، دانش علمی هوش مصنوعی را صرفاً با پاسخ‌دهی به پرسش‌های چهارگزینه‌ای و مجزا می‌سنجند. اما بنچمارک Terminal-Bench-Science واقعاً عیار ایجنت را در دنیای واقعی محک می‌زند: اینکه آیا ایجنت می‌تواند یک فرایند محاسباتی کامل را تا انتها پیش ببرد، متغیرهای میانی را مدیریت کند، در صورت بروز خطای نرم‌افزاری خودش را بازیابی کند و خروجی‌هایی دقیق و مطابق با استانداردهای سخت‌گیرانه تولید نماید؟

تنها یک هفته پس از انتشار نسخه ۰.۱، آزمایشگاه‌های پیشرو انتشار نتایج خود را آغاز کردند و حتی ردپای این بنچمارک در یادداشت‌های انتشار مدل‌های Claude Fable 5.1 و GPT-6 Astra دیده شد. آزمون «همه یا هیچ» این سیستم نقاط ضعفی را برمی‌ملا می‌کند که در ارزیابی‌های امتیازبندی نسبی پنهان می‌ماند؛ خطاهای جزئی در فرمت‌بندی، محاسبات یا پردازش داده‌ها که در دنیای واقعی پژوهش می‌توانند کل نتایج یک تحقیق علمی را باطل کنند.

تیم توسعه‌دهنده این پروژه قصد دارد نسخه‌های به‌روزرسانی منظمی عرضه کند تا تسک‌ها همواره متناسب با جهش مدل‌ها به‌روز بمانند. در این چرخه، متخصصان رشته‌های گوناگون سناریوهای پژوهشی را پیشنهاد می‌دهند، بازبین‌های فنی آن‌ها را به تسک‌های تکرارپذیر ترمینال تبدیل می‌کنند و توسعه‌دهندگان مدل‌ها می‌توانند با تحلیل شکست‌های ایجنت، مهارت کار با ابزار‌ها را در هوش مصنوعی تقویت کنند.

اجرای بنچمارک و مشارکت در توسعه تسک‌ها

توسعه‌دهندگان و پژوهشگران می‌توانند تسک‌ها و فریم‌ورک ارزیابی را در مخزن گیت‌هاب این پروژه بررسی کنند. نتایج این بنچمارک داده‌های ارزشمندی را در اختیار تیم‌هایی قرار می‌دهد که:

  • به دنبال ساخت ایجنت‌های تخصصی علم و بررسی توانایی آن‌ها در فراتر رفتن از کدنویسی صرف به سمت مسائل علمی هستند.
  • می‌خواهند نسبت میان میزان استدلال و هزینه محاسباتی را با دقت نهایی مقایسه کنند.
  • قصد دارند مدل‌های متن‌باز و ابری را تحت یک زیرساخت ایجنت یکسان و عادلانه بسنجند.
  • به اشتراک‌گذاری روندهای پژوهشی شبیه به کار‌های واقعی آزمایشگاهی یا محاسباتی علاقه‌مندند.

این پروژه هم‌اکنون در حال پذیرش تسک‌های جدید برای نسخه ۰.۲ است و طبق اطلاعات مندرج در صفحه مشارکت وب‌سایت بنچمارک، پنجم اکتبر آخرین مهلت ارسال پیشنهاد‌ها تعیین شده است. نام مشارکت‌کنندگانی که تسک آن‌ها پذیرفته شود به عنوان همکار نویسنده در مقاله علمی نهایی ثبت خواهد شد و هر پیشنهاد پیش از تأیید، تحت ارزیابی موشکافانه فنی و علمی قرار می‌گیرد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

غوغای مدل فوق‌العاده سبک Gender-Classifier-Mini؛ ثبت دقت خیره‌کننده ۹۷.۲ درصدی و ۷۷۸ هزار دانلود ماهانه!
آخرین اخبار

غوغای مدل فوق‌العاده سبک Gender-Classifier-Mini؛ ثبت دقت خیره‌کننده ۹۷.۲ درصدی و ۷۷۸ هزار دانلود ماهانه!

مدل بینایی جمع‌وجور و سبک Gender-Classifier-Mini توانسته با ثبت دقت ۹۷.۲ درصدی در تشخیص چهره، به بیش از ۷۷۸ هزار دانلود ماهانه در پلتفرم هاگینگ فیس دست پیدا کند. این مدل متن‌باز با حجم اندک خود به‌راحتی روی لپ‌تاپ‌های شخصی اجرا می‌شود و نشان می‌دهد که برای کار‌های تخصصی بینایی ماشین، همیشه نیازی به مدل‌های غول‌پیکر و پردازنده‌های سنگین ابری نیست.

۲ دقیقه مطالعه
۰
۱۳ مهر
زنگ خطر در سیستم درمان؛ نفوذ ایجنت‌های خودسر هوش مصنوعی به بیمارستان‌ها بدون مجوز IT!
آخرین اخبار

زنگ خطر در سیستم درمان؛ نفوذ ایجنت‌های خودسر هوش مصنوعی به بیمارستان‌ها بدون مجوز IT!

در حالی که بیمارستان‌ها سخت درگیر مهار حملات سایبری هستند، تهدید غیرمنتظره جدیدی سر برآورده است: ایجنت‌های هوش مصنوعی که بدون تأیید بخش IT در سیستم‌های درمانی فعالیت می‌کنند. این دستیارهای خودمختار حالا با دسترسی به حساس‌ترین پرونده‌های پزشکی، مرزهای حریم خصوصی و امنیت داده‌ها را به چالش کشیده‌اند.

۴ دقیقه مطالعه
۰
۱۳ مهر
راز باهوش‌تر شدن هوش مصنوعی در برنامه «۶۰ دقیقه»؛ وقتی بلعیدن کل اینترنت هم کافی نیست!
آخرین اخبار

راز باهوش‌تر شدن هوش مصنوعی در برنامه «۶۰ دقیقه»؛ وقتی بلعیدن کل اینترنت هم کافی نیست!

مدل‌های هوش مصنوعی دیگر نمی‌توانند فقط با بلعیدن داده‌های اینترنت هوشمند‌تر شوند و برای جهش بعدی به تخصص واقعی انسان‌ها نیاز دارند. برنامه مشهور «۶۰ دقیقه» در گزارشی جذاب به سراغ استارتاپ مرکور رفته؛ جایی که بیش از ۱۰۰ هزار متخصص دست‌به‌کار شده‌اند تا به هوش مصنوعی مهارت‌های پیچیده انسانی بیاموزند.

۲ دقیقه مطالعه
۰
۱۳ مهر