پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

صدرنشینی Claude Opus 5.5 در شاخص Vals AI؛ درخشش مدل‌های اقتصادی MiMo و GPT-6

انتشار:۴ مهر ۱۴۰۵(۲ روز پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

بر اساس ارزیابی‌های شاخص Vals AI، مدل Claude Opus 5.5 با کسب امتیاز ۶۹٫۶۹ درصد جایگاه نخست عملکرد را به دست آورده است. در همین حال، مدل‌های جدید GPT-6 و سری MiMo با کاهش چشمگیر هزینه‌های استنتاج، فصلی تازه از رقابت بر سر کارایی اقتصادی در هوش مصنوعی را رقم زده‌اند.

صدرنشینی Claude Opus 5.5 در شاخص Vals AI؛ درخشش مدل‌های اقتصادی MiMo و GPT-6

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل Claude Opus 5.5 با کسب امتیاز ۶۹٫۶۹ درصد در شاخص Vals AI و درخشش در ۶ بنچمارک مختلف به رتبه اول دست یافت.
  • دو مدل GPT-6 Sol و GPT-6 Luna با کاهش نزدیک به ۵۰ درصدی هزینه‌ها، رویکرد OpenAI را به سمت افزایش بهره‌وری اقتصادی تغییر داده‌اند.
  • مدل‌های سری MiMo V2.6 شیائومی با هزینه‌ای تا ۱۰۰ برابر کمتر، عملکردی بسیار نزدیک به قدرتمندترین سیستم‌های اختصاصی به نمایش گذاشتند.
  • هزینه بالای استنتاج Opus 5.5 (حدود ۲۲٫۳۰ دلار به ازای هر تست) به دلیل استدلال پیوسته، چالش‌هایی را برای استقرار گسترده آن ایجاد می‌کند.

صدرنشینی Claude Opus 5.5 در شاخص Vals هم‌زمان با کاهش هزینه‌ها توسط GPT-6 و MiMo

پلتفرم Vals AI عملکرد ۶ مدل هوش مصنوعی عرضه‌شده طی یک هفته اخیر را از طریق شاخص اختصاصی خود (Vals Index) مورد ارزیابی قرار داده است. این شاخص ترکیبی و وزن‌دهی‌شده، بنچمارک‌های مالی، کدنویسی و حقوقی را برای شبیه‌سازی کارهای دنیای واقعی پوشش می‌دهد. چندین آزمون ایجنتی در این ارزیابی گنجانده شده‌اند که مدل‌ها را ملزم به استفاده از ابزارها و انجام وظایف چندمرحله‌ای می‌کنند.

نتایج این ارزیابی، مدل Claude Opus 5.5 را در صدر جدول قرار داده است؛ در حالی که از یک سو نشان‌دهنده کاهش هزینه‌های استنتاج توسط OpenAI است و از سوی دیگر، مدل‌های MiMo شرکت Xiaomi را با کسری ناچیز از قیمت مدل‌های تجاری برتر، در جایگاهی نزدیک به آنها نشان می‌دهد. با این حال، رتبه‌بندی‌های کلی همچنان افت عملکرد در برخی حوزه‌های تخصصی، رفتارهای مسیردهی مدل (Model Routing) و تفاوت‌های فاحش در میزان مصرف توکن را پنهان می‌کنند.

مدل
شاخص Vals
جایگاه
شاخص هزینه
Claude Opus 5.5
۶۹٫۶۹٪
رتبه ۱ از ۶۳
۲۲٫۳۰ دلار به ازای هر تست
GPT-6 Sol
۶۲٫۶٪
رتبه ۸
۷٫۵۶ دلار به ازای هر تست
Grok 4.7
۶۰٫۲٪
رتبه ۱۲
حدود ۲٫۶ برابر Grok 4.6
MiMo V2.6 Flash
۵۹٫۶٪
پیشتاز در CyberBench
۰٫۲۰ دلار به ازای هر تست
MiMo V2.6 Pro
۵۹٫۵٪
رتبه ۲ مدل‌های وزن‌باز
۰٫۳۹ دلار به ازای هر تست
GPT-6 Luna
۵۸٫۵٪
رتبه ۲۰
۰٫۴۲ دلار به ازای هر تست

برتری Opus 5.5 در وظایف ایجنتی به بهای هزینه بالاتر

مدل Claude Opus 5.5 توانست بالاتر از Claude Fable 5.1 (با امتیاز ۶۸٫۸۳ درصد)، Claude Opus 5 (با امتیاز ۶۷٫۲۱ درصد) و GPT-6 Astra (با امتیاز ۶۶٫۶۱ درصد) قرار گیرد. طبق گزارش Vals، این مدل در ۶ جدول رده‌بندی مختلف رتبه اول را کسب کرده که از جمله مهم‌ترین آن‌ها می‌توان به امتیاز ۶۱٫۶۲ درصد در Terminal-Bench 4.0، امتیاز ۹۱٫۴۳ درصد در MedScribe، امتیاز ۳۷٫۱۳ درصد در شاخص Vals RSI و امتیاز بی‌نقص ۱۰۰ درصد در ProofBench v1.1 اشاره کرد.

در وظیفه آموزش مدل زبانی در «شاخص بهبود خودکار بازگشتی» (Recursive Self-Improvement Index)، مدل Opus 5.5 توانست یک مدل کوچک را در چارچوب بودجه زمانی ۲۴ ساعته آموزش دهد و عملکردی فراتر از خط مبنای انسانی ثبت‌شده از خود به نمایش بگذارد. در پی این نتیجه، موسسه Vals پیش‌بینی تاریخ تحقق کامل خودبهبودی بازگشتی را با یک ماه جلو انداختن، به آگوست ۲۰۲۷ تغییر داد. البته این تاریخ حاصل برون‌یابی از یک تسک آزمایشی و محدود است و به معنای اثبات عینی خودبهبودی بازگشتی بدون محدودیت نیست.

بنچمارک ProgramBench یکی از واضح‌ترین پیشرفت‌های این مدل را به نمایش گذاشت؛ جایی که Opus 5.5 موفق شد ۱۸٫۵ درصد از وظایف را به‌طور کامل حل کند، در حالی که این رقم برای Fable 5.1 برابر ۷ درصد، برای GPT-6 Astra معادل ۵٫۵ درصد و برای Opus 5 تنها ۳ درصد بود. اجرای این آزمون‌ها ۲٫۴ ساعت طول کشید و ۴۲٫۶۶ دلار به ازای هر وظیفه هزینه در بر داشت.

در مقایسه با Opus 5، مدل جدیدتر میانگین هزینه به ازای هر تست را از ۱۸٫۸۱ دلار به ۲۲٫۳۰ دلار افزایش داده است. علاوه بر این، این مدل در حوزه‌های MedCode، مزایای عمومی (Public Benefits)، پژوهش‌های حقوقی (Legal Research)، بنچمارک Tax Agent و HLAB با افت عملکرد روبه‌رو شده است که این افت عمدتاً در زمینه‌های بازیابی اطلاعات، وفاداری به منابع و تطابق با معیارها متمرکز بوده است. همچنین کسب امتیاز ۳٫۷۵ درصد در بنچمارک Legal Agent شرکت Harvey، این مدل را در رتبه ۳۱ از میان ۶۴ مدل قرار داد.

پیچیدگی‌های استقرار ناشی از مسیردهی و مصرف توکن

  • سازوکارهای امنیتی سمت سرور در شرکت Anthropic، اغلب درخواست‌های مرتبط با امنیت سایبری را به مدل Claude Opus 4.8 هدایت می‌کنند. همچنین درخواست‌های حوزه زیست‌شناسی نیز در صورت احراز هویت نشدن حساب کاربری، به مدل Claude Opus 5 ارجاع داده می‌شوند. اگر آزمون‌هایی که با بازگشت به مدل‌های دیگر انجام شده‌اند را ناموفق در نظر بگیریم، امتیاز ثبت‌شده در بنچمارک SRE Bench از ۳۳٫۵۹ درصد به ۵٫۳۴ درصد سقوط می‌کند.
  • موسسه تحقیقاتی Artificial Analysis میزان تولید توکن این مدل را حدود ۱۱۹٬۰۰۰ توکن خروجی به ازای هر تسک در شاخص هوش اندازه‌گیری کرده است، در حالی که این میزان برای Opus 5 حدود ۷۳٬۰۰۰ توکن، برای Fable 5.1 حدود ۷۸٬۰۰۰ توکن و برای GPT-6 Astra نزدیک به ۲۷٬۰۰۰ توکن بوده است. از آنجا که توکن‌های تفکر (Thinking Tokens) به عنوان توکن خروجی محاسبه می‌شوند، قابلیت استدلال تطبیقی همواره فعال مستقیماً در افزایش هزینه‌های تست این مدل نقش دارد.

کاهش قیمت GPT-6 در عین حفظ نسبی امتیازات قبلی

مدل GPT-6 Sol امتیازی معادل ۶۲٫۶ درصد به دست آورد که تنها یک درصد کمتر از امتیاز ۶۳٫۷ درصدی مدل GPT-5.6 Sol است؛ اما هزینه به ازای هر تست را با ۴۷ درصد کاهش از ۱۴٫۲۱ دلار به ۷٫۵۶ دلار رسانده است. این مدل شاهد بهبود ۷٫۳ درصدی در Vibe Code Bench، رشد ۱۸٫۵ درصدی در Terminal-Bench Science و رشد ۶٫۵ درصدی در Terminal-Bench 4.0 بود، هرچند امتیازات آن در بخش‌های پژوهش حقوقی و Tax Agent کاهش یافت.

از سوی دیگر، مدل GPT-6 Luna توانست هزینه‌ها را با ۴۶ درصد کاهش به ۰٫۴۲ دلار به ازای هر تست برساند. این مدل در بنچمارک‌های Terminal-Bench، MysteryMechanism و Vibe Code Bench رشد اندکی را ثبت کرد، اما در بخش ایجنت مالی (Finance Agent) با پسرفت جزئی همراه شد. این دو محصول جدید نشان می‌دهند استراتژی OpenAI به جای ارتقای دقت کلی، بر شیفت دادن منحنی قیمت-عملکرد از طریق کاهش هزینه‌های استنتاج متمرکز شده است.

رسیدن MiMo به امتیاز ۵۹٫۶ درصد با هزینه ۲۰ سنتی

مدل MiMo V2.6 Flash در شاخص Vals Index با هزینه ۰٫۲۰ دلار برای هر تست (حدود ۱ درصد هزینه Opus 5.5) به امتیاز ۵۹٫۶ درصد رسید. این مدل همچنین با کسب امتیاز ۷۵٫۴ درصد، در صدر بنچمارک CyberBench قرار گرفت.

مدل MiMo V2.6 Pro نیز با امتیاز ۵۹٫۵ درصد، با ۲۷ پله صعود نسبت به رتبه ۴۴ نسخه قبلی (V2.5 Pro) روبه‌رو شد. بیشترین میزان رشد گزارش‌شده برای این مدل در بنچمارک‌ها به شرح زیر است:

  • Vibe Code Bench: ۵۱٫۱ درصد
  • ProofBench: ۴۸ درصد
  • پژوهش حقوقی (Legal Research): ۳۱٫۲ درصد و دستیابی به رتبه ۱۱

نسخه Pro در حال حاضر با هزینه ۰٫۳۹ دلار به ازای هر تست، در جایگاه دوم مدل‌های وزن‌باز قرار دارد. ترکیب قیمت اقتصادی، دسترسی به وزن‌های مدل و امتیازات ارتقایافته در کدنویسی، این مدل را به گزینه‌ای بسیار کاربردی برای خطوط پردازشی با ترافیک بالا تبدیل می‌کند؛ هرچند ارزیابی آن بر اساس حجم کاری واقعی هر پروژه الزامی خواهد بود.

پیشرفت Grok 4.7 در کدنویسی و افت در اثبات قضایا

مدل Grok 4.7 توانست با صعود از رتبه ۱۹ (نسخه Grok 4.6) به جایگاه دوازدهم جدول دست پیدا کند. امتیاز این مدل در بنچمارک Vibe Code Bench با رشد نزدیک به ۱۰ درصدی به ۸۶٫۲ درصد رسید و در Terminal-Bench 4.0 نیز ۱۱ درصد بهبود یافت و در بنچمارک Legal Agent شرکت Harvey به جایگاه هفتم تکیه زد. با این حال، هزینه هر تست برای این مدل حدود ۲٫۶ برابر Grok 4.6 افزایش یافت و امتیاز آن در ProofBench با افت ۲۵ درصدی روبه‌رو شد.

تسخیر رتبه‌های برتر توسط مدل‌های تازه‌نفس

گزارش Vals نشان می‌دهد ۱۸ مدل از میان ۲۰ مدل برتر جدول طی سه ماه گذشته عرضه شده‌اند. بخش عمده پیشرفت‌های اخیر در زمینه کدنویسی و استفاده ایجنتی از ابزارها متمرکز بوده است و تغییرات کمتری در آزمون‌های دانش عمومی و استدلال به چشم می‌خورد.

شکاف کلی بین پیشتاز مدل‌های تجاری و بهترین نتیجه مدل MiMo تنها حدود ۱۰ واحد درصد است، در حالی که اختلاف هزینه تست آنها از ۱۰۰ برابر فراتر می‌رود. چنین فاصله‌ای، فضا را برای ایجاد سیستم‌های هیبریدی مهیا می‌سازد؛ سیستم‌هایی که کارهای روتین را به مدل‌های ارزان هدایت می‌کنند و مدل‌های گران‌قیمت را برای وظایف فوق‌العاده پیچیده اختصاص می‌دهند.

پیشنهاد مدل‌ها بر اساس نوع بار کاری

نوع بار کاری
گزینه پیشنهادی برای ارزیابی
دلیل انتخاب
کدنویسی ایجنتی و کارهای ترمینال
Claude Opus 5.5
پیشتاز در ProgramBench، Terminal-Bench و نتایج مجموع
خطوط پردازش حقوقی یا مالیاتی
Claude Opus 5 یا Fable 5.1
افت عملکرد Opus 5.5 در پژوهش حقوقی، مالیات، بازیابی و تطابق با معیارها
استنتاج اقتصادی با توان پردازشی بالا
MiMo V2.6 Flash
امتیاز مجموع ۵۹٫۶ درصد با هزینه ۰٫۲۰ دلار به ازای هر تست
استقرار مدل‌های وزن‌باز
MiMo V2.6 Pro
رتبه دوم در میان مدل‌های وزن‌باز با جهش چشمگیر در کدنویسی
کاهش هزینه‌ها در اکوسیستم OpenAI
GPT-6 Sol یا Luna
کاهش قابل توجه قیمت همراه با حفظ عملکرد نزدیک به نسل‌های قبل

در محیط‌های عملیاتی، انتخاب مدل بر اساس این فهرست باید همراه با ارزیابی اختصاصی حجم کاری شامل تأخیر، مصرف توکن، مسیردهی پشتیبان (Fallback)، دقت بازیابی و انطباق با قواعد صورت پذیرد؛ زیرا این عوامل می‌توانند برتری ظاهری حاصل از یک امتیاز تک‌بعدی را دگرگون کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر