پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاخص جنجالی هرمس؛ رده‌بندی دقیق ایجنت‌های هوش مصنوعی بر اساس کیفیت و هزینه واقعی

انتشار:۱۵ مهر ۱۴۰۵(۲ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

مجموعه تحقیقاتی نوس ریسرچ با معرفی شاخص هرمس (Hermes Index)، مدل‌های برتر هوش مصنوعی را در محیط عملیاتی ایجنت‌ها بر اساس ترکیب کارایی و هزینه واقعی هر تسک رده‌بندی کرد. در این ارزیابی دقیق، مدل قدرتمند Claude Opus 5.5 با کسب امتیاز ۶۳.۳۱ در صدر جدول قرار گرفت، در حالی که مدل‌های اقتصادی و ارزان‌قیمت نیز کارایی فوق‌العاده‌ای در مقایسه با قیمت خود به نمایش گذاشتند.

شاخص جنجالی هرمس؛ رده‌بندی دقیق ایجنت‌های هوش مصنوعی بر اساس کیفیت و هزینه واقعی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مجموعه نوس ریسرچ شاخص هرمس (Hermes Index) را راه‌اندازی کرد؛ معیاری جدید که مدل‌های مطرح هوش مصنوعی را در یک محیط یکپارچه ایجنتی، هم از نظر قدرت پردازش و هم هزینه دلاری دقیق هر تسک می‌سنجد.
  • مدل Claude Opus 5.5 با کسب امتیاز ۶۳.۳۱ رتبه اول را از آن خود کرد و در مقایسه با رقیبش GPT 6 Astra، هم عملکرد بسیار بهتری ثبت کرد و هم هزینه اجرای هر تسک با آن کم‌تر از نصف بود.
  • نتایج این شاخص نشان می‌دهد گزینه‌های ارزان‌تری مثل DeepSeek V4.1 Flash و Claude Sonnet 5.5 به مرز بهره‌وری اقتصادی رسیده‌اند و به توسعه‌دهندگان در انتخاب بهینه مدل و کنترل هزینه‌ها کمک شایانی می‌کنند.

شاخص هرمس؛ رده‌بندی ایجنت‌های هوش مصنوعی بر اساس کیفیت و هزینه واقعی

مجموعه تحقیقاتی نوس ریسرچ (Nous Research) به‌تازگی لیدربورد جدیدی به نام شاخص هرمس (Hermes Index) را رونمایی کرده است؛ معیاری تازه که عملکرد و هزینه عملیاتی مدل‌های هوش مصنوعی را درون یک چرخه واقعی ایجنتی مقایسه می‌کند. این شاخص میانگین نتایج چهار بنچمارک معتبر ایجنت‌ها را در محیط اجرایی یکسانِ «هرمس ایجنت» محاسبه کرده و در کنار امتیاز هر مدل، میانگین هزینه دلاری آن به ازای هر تسک را هم گزارش می‌دهد. کنار هم قرار گرفتن این دو عدد، تعادل ظریف بین کارایی و هزینه را شفاف می‌کند؛ نکته کلیدی مهمی که رده‌بندی‌های صرفاً امتیازی همیشه از آن غافل می‌شوند.

در این ارزیابی، هر مدل در چهار بنچمارک مختلف شامل Hermes Bench ،TerminalBench 4 ،TerminalBench Science و SkillsBench محک می‌خورد و شاخص نهایی، میانگین امتیازات و هزینه‌ها در تمام این آزمون‌هاست. تمامی آزمون‌ها با متد pass@1 انجام شده‌اند، یعنی هر مدل برای حل هر تسک فقط یک شانس و فرصت دارد. همچنین در مدل‌هایی که امکان تنظیم سطح استدلال وجود داشته، تلاش استدلالی (Reasoning effort) روی حداکثر (High) تنظیم شده است. اجرای همه مدل‌ها روی یک فریم‌ورک مشترک تضمین می‌کند که تمامی ایجنت‌ها در یک محیط عملیاتی و شرایط پردازشی کاملاً یکسان وظایفشان را دریافت کنند.

پیشتازی مقتدرانه اوپوس و خط‌شکنی مدل‌های اقتصادی

جدول منتشرشده از این لیدربورد نشان می‌دهد که مدل Claude Opus 5.5 جایگاه نخست را مقتدرانه تصاحب کرده و بعد از آن، مدل‌های GPT 6 Astra و Claude Sonnet 5.5 در رتبه‌های دوم و سوم قرار دارند. جدول زیر پنج مدل برتر جدول به‌همراه دو گزینه اقتصادی و ارزان‌قیمت را نشان می‌دهد که روی «مرز بهره‌وری اقتصادی» جای گرفته‌اند.

رتبه
مدل
شاخص هرمس
میانگین هزینه هر تسک
1
Claude Opus 5.5
63.31
۴.۹۹ دلار
2
GPT 6 Astra
56.25
۱۱.۶۱ دلار
3
Claude Sonnet 5.5
53.14
۲.۸۲ دلار
4
GPT 6 Sol
44.10
۲.۲۳ دلار
5
Grok 4.7
39.32
۱۰.۷۷ دلار
9
DeepSeek V4.1 Flash
36.91
۰.۲۵۹ دلار
14
Ling 3.0 Flash
21.56
۰.۰۵۴ دلار

مدل Claude Opus 5.5 موفق شده ۷.۰۶ امتیاز بیش‌تر از GPT 6 Astra کسب کند، در حالی که هزینه آن برای هر تسک کم‌تر از نصف رقیبش است! از طرف دیگر، Sonnet 5.5 با هزینه‌ای کم‌تر از یک‌چهارم مدل Astra توانسته جایگاه سوم را به خود اختصاص دهد. نوس ریسرچ شش مدل را روی مرز پارتو (Pareto Frontier) شناسایی کرده است: Claude Opus 5.5 ،Claude Sonnet 5.5 ،GPT 6 Sol ،DeepSeek V4.1 Flash ،GPT 6 Luna و Ling 3.0 Flash. یک مدل زمانی به این مرز طلایی می‌رسد که هیچ مدل دیگری نتواند هم‌زمان هم ارزان‌تر از آن باشد و هم امتیاز بالاتری ثبت کند.

چهار بنچمارک جدی برای شبیه‌سازی کار‌های واقعی ایجنت‌ها

سه بخش از این ارزیابی از بنچمارک‌های موجود دنیای ایجنت‌ها قرض گرفته شده‌اند: TerminalBench 4 ،TerminalBench Science و SkillsBench. نوس ریسرچ همچنین آزمون اختصاصی Hermes Bench را با ۱۵۰ تسک متنوع در ۲۵ دسته‌بندی مختلف اضافه کرده که حوزه‌هایی مثل تحقیق و پژوهش، کار با ابزارها، حافظه، ایمنی، نمودارها، هنر و اسکیل‌های ویژه هرمس را پوشش می‌دهد. در این آزمون‌ها، به هر ایجنت یک محیط کاری (Workspace) شامل فایل‌های واقعی داده می‌شود، برخی تسک‌ها دارای مراحل گفت‌وگوی تکمیلی هستند و سیستم‌های ارزیابی، فایل‌های تولیدشده نهایی و وضعیت کلی محیط را بررسی می‌کنند.

ترکیب وظایف در بنچمارک اختصاصی هرمس شامل موارد زیر است:

  • ۸۷ تسک اسکیل (مهارتی): شامل جستجوی کار، اولویت‌بندی ایمیل‌ها، رسم دیاگرام، تناسب اندام، تحلیل داده‌های ورزشی و انرژی، کار با نقشه، بازبینی کد، پایگاه‌های ویکی و مقالات arXiv.
  • ۴۳ تسک پژوهشی و تحقیقاتی: شامل مقایسه و تطبیق داده‌ها، حل تناقض میان منابع، زمان‌بندی، فرایند خرید، راستی‌آزمایی مستندات و حفظ کار‌های موجود.
  • ۲۰ تسک تکمیلی: شامل پردازش‌های تصویری، حافظه، کار با ابزار‌های مرورگر و خودداری امنیتی از اجرای دستورات مخرب گیت (Git).

بنچمارک هرمس از ترکیب بررسی‌های دقیق قطعی و داوری مبتنی بر مدل‌های زبانی بهره می‌برد:

  • ۶۴ تسک با اعتبارسنجی خودکار فایل‌ها، وضعیت محیط و شواهد استفاده از ابزار‌ها داوری می‌شوند.
  • ۷۷ تسک از ترکیب بررسی‌های قطعی با یک مدل زبانی داور (LLM Judge) بر اساس معیارهای مشخص امتیاز می‌گیرند.
  • ۱ تسک به ارزیابی دقیق مبتنی بر استانداردهای مدل داور متکی است.
  • ۸ تسک بصری هر دیاگرام خروجی را سه بار بررسی کرده و میانگین نمرات ثبت‌شده را لحاظ می‌کنند.

افشای پاسخ‌ها، حذف برخی داده‌ها و نتایج مشروط

نتایج آزمون TerminalBench 4 در این رده‌بندی چهار تسک سنگین پردازنده گرافیکی (GPU) را در بر نمی‌گیرد، بنابراین شاخص هرمس نسخه سبک‌تری از این بنچمارک را پوشش داده است. علاوه بر این، وجود علامت ستاره در کنار نام مدل‌ها روی لیدربورد نشان‌دهنده اجرای ناقص یا برآورد تقریبی هزینه‌هاست که نیازمند اجرای مجدد خواهد بود؛ در حال حاضر آمار‌های مربوط به Claude Opus 5.5 و Claude Sonnet 5.5 در بنچمارک TerminalBench 4 با همین نشان مشخص شده‌اند.

نکته جالب و عجیب این بود که برخی از ایجنت‌ها در حین آزمون SkillsBench توانستند مخزن عمومی این بنچمارک را در اینترنت پیدا کرده و مستقیماً از پاسخ‌های منتشرشده آن استفاده کنند! به همین خاطر، جدول رده‌بندی یک نمره تمیز (Clean Score) بدون احتساب تسک‌های لو رفته ارائه داده و امتیاز خام را هم جداگانه نمایش می‌دهد. تفاوت چشمگیر میان نمرات خام و نمرات تمیز در مدل‌هایی نظیر Grok 4.7 ،Gemini Flash 3.8 و DeepSeek V4.1 Flash به‌خوبی نشان می‌دهد پدیده درز بنچمارک (Leakage) تا چه اندازه می‌تواند نتایج واقعی را دستخوش تغییر کند.

شاخص هرمس؛ راهنمای عملی برای هدایت و بودجه‌بندی ایجنت‌ها

اجرای تمام مدل‌ها روی فریم‌ورک یکسان هرمس ایجنت (Hermes Agent)، اختلاف‌های ناشی از محیط‌های اجرایی اختصاصی و تنظیمات مختلف کدگشایی را به حداقل می‌رساند. گزارش دقیق هزینه در کنار کارایی به تیم‌های فنی کمک می‌کند تصمیم‌های هوشمندانه‌تری برای روتینگ (مسیریابی هوشمند وظایف) بگیرند؛ مثلاً تصمیم بگیرند که آیا می‌توان از یک مدل واحد برای تمام کار‌ها استفاده کرد یا بهتر است مدل‌های گران‌قیمت را فقط برای مراحل حساس و تسک‌های پیچیده رزرو کرد.

البته باید توجه داشت که این نتایج کاملاً وابسته به فریم‌ورک هرمس ایجنت، ترکیب همین تسک‌ها، تنظیمات استدلال بالا (High Reasoning) و ارزیابی تک‌تلاشی (pass@1) هستند. استفاده از فریم‌ورک‌های دیگر، کاهش بودجه محاسباتی استدلال، تلاش‌های مکرر یا ابزار‌های اختصاصی محیط پروداکشن می‌تواند هم کارایی و هم هزینه‌ها را به کلی تغییر دهد. علاوه بر این، تعرفه‌های ارائه‌دهندگان و میزان مصرف توکن نیز همواره در حال تغییر است؛ بنابراین تیم‌های توسعه باید مدل‌های منتخب را حتماً در پروژه‌های واقعی خود نیز اعتبارسنجی کنند.

بر اساس قیمت‌های اعلام‌شده، مدل DeepSeek V4.1 Flash با هزینه ناچیز ۰.۲۵۹ دلار به ازای هر تسک، امتیاز ۳۶.۹۱ را به ثبت می‌رساند، در حالی که اجرای GPT 6 Astra برای هر تسک ۱۱.۶۱ دلار هزینه برمی‌دارد و امتیاز ۵۶.۲۵ را کسب می‌کند. از سوی دیگر، Sonnet 5.5 تنها با ۰.۵۹ دلار هزینه بیش‌تر نسبت به GPT 6 Sol، جهش امتیازی ۹.۰۴ پله‌ای را ثبت کرده و مدل پرچمدار Opus 5.5 هم با ۲.۱۷ دلار هزینه بیش‌تر نسبت به Sonnet، بیش از ۱۰.۱۷ امتیاز به کارایی اضافه می‌کند. این آمار‌های ملموس، معیارهای شفاف و دقیقی در اختیار مهندسان نرم‌افزار قرار می‌دهد تا مدل پیش‌فرض مناسب را انتخاب کنند، لایه‌های ارتقا (Escalation) را مشخص سازند و هزینه‌های عملیاتی ایجنت‌ها را در مقیاس بزرگ به بهترین شکل مدیریت کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

مدیرعامل اطلسین: «کار با هوش مصنوعی دیگر تک‌نفره نیست؛ ایجنت‌ها هم‌تیمی شما هستند، نه جایگزین‌تان!»
آخرین اخبار

مدیرعامل اطلسین: «کار با هوش مصنوعی دیگر تک‌نفره نیست؛ ایجنت‌ها هم‌تیمی شما هستند، نه جایگزین‌تان!»

مدیرعامل اطلسین در رویداد اخیر این شرکت اعلام کرد که دوران کار تک‌نفره با هوش مصنوعی به پایان رسیده و اکنون وارد عصر همکاری چندنفره انسان‌ها و ایجنت‌ها شده‌ایم. او تأکید دارد هوش مصنوعی بدون درک بستر اطلاعاتی (کانتکست) سازمان کارایی چندانی ندارد و ایجنت‌ها نه برای حذف نیروها، بلکه برای پیوستن به تیم‌ها طراحی شده‌اند.

۳ دقیقه مطالعه
۰
۱۵ مهر
شرط‌بندی پاسکال به داد مدیران رسید: چطور در قمار بزرگ AGI بازنده نباشیم؟
آخرین اخبار

شرط‌بندی پاسکال به داد مدیران رسید: چطور در قمار بزرگ AGI بازنده نباشیم؟

با پررنگ‌تر شدن زمزمه‌های ظهور هوش عمومی مصنوعی (AGI)، مدیران شرکت‌ها سر یک دوراهی بزرگ گیر افتاده‌اند: چقدر باید روی هوش مصنوعی شرط بست؟ جالب اینجاست که پاسخی دقیق و کاربردی برای این معمای مدرن، در نظریه مشهور «شرط‌بندی پاسکال» از قرن هفدهم پنهان شده است.

۳ دقیقه مطالعه
۰
۱۵ مهر
دستور توقف ساخت دو دیتاسنتر بزرگ گوگل در فنلاند؛ ترمز غول هوش مصنوعی در «تگزاس اروپا» کشیده شد!
آخرین اخبار

دستور توقف ساخت دو دیتاسنتر بزرگ گوگل در فنلاند؛ ترمز غول هوش مصنوعی در «تگزاس اروپا» کشیده شد!

سازمان‌های نظارتی فنلاند تنها یک ماه پس از اعلام طرح سرمایه‌گذاری ۱۵ میلیارد دلاری گوگل، دستور توقف ساخت دو دیتاسنتر غول‌پیکر هوش مصنوعی این شرکت را به دلیل نگرانی‌های زیست‌محیطی صادر کردند. فنلاند که به خاطر منابع انرژی پایدار به «تگزاس اروپا» برای میزبانی هوش مصنوعی شهرت پیدا کرده، حالا نشان داده که حتی برای بزرگ‌ترین غول‌های فناوری هم استانداردهای سفت‌وسختی دارد.

۳ دقیقه مطالعه
۰
۱۵ مهر