صدرنشینی Claude Opus 5.5 در شاخص Vals AI؛ درخشش مدلهای اقتصادی MiMo و GPT-6
بر اساس ارزیابیهای شاخص Vals AI، مدل Claude Opus 5.5 با کسب امتیاز ۶۹٫۶۹ درصد جایگاه نخست عملکرد را به دست آورده است. در همین حال، مدلهای جدید GPT-6 و سری MiMo با کاهش چشمگیر هزینههای استنتاج، فصلی تازه از رقابت بر سر کارایی اقتصادی در هوش مصنوعی را رقم زدهاند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل Claude Opus 5.5 با کسب امتیاز ۶۹٫۶۹ درصد در شاخص Vals AI و درخشش در ۶ بنچمارک مختلف به رتبه اول دست یافت.
- دو مدل GPT-6 Sol و GPT-6 Luna با کاهش نزدیک به ۵۰ درصدی هزینهها، رویکرد OpenAI را به سمت افزایش بهرهوری اقتصادی تغییر دادهاند.
- مدلهای سری MiMo V2.6 شیائومی با هزینهای تا ۱۰۰ برابر کمتر، عملکردی بسیار نزدیک به قدرتمندترین سیستمهای اختصاصی به نمایش گذاشتند.
- هزینه بالای استنتاج Opus 5.5 (حدود ۲۲٫۳۰ دلار به ازای هر تست) به دلیل استدلال پیوسته، چالشهایی را برای استقرار گسترده آن ایجاد میکند.
صدرنشینی Claude Opus 5.5 در شاخص Vals همزمان با کاهش هزینهها توسط GPT-6 و MiMo
پلتفرم Vals AI عملکرد ۶ مدل هوش مصنوعی عرضهشده طی یک هفته اخیر را از طریق شاخص اختصاصی خود (Vals Index) مورد ارزیابی قرار داده است. این شاخص ترکیبی و وزندهیشده، بنچمارکهای مالی، کدنویسی و حقوقی را برای شبیهسازی کارهای دنیای واقعی پوشش میدهد. چندین آزمون ایجنتی در این ارزیابی گنجانده شدهاند که مدلها را ملزم به استفاده از ابزارها و انجام وظایف چندمرحلهای میکنند.
نتایج این ارزیابی، مدل Claude Opus 5.5 را در صدر جدول قرار داده است؛ در حالی که از یک سو نشاندهنده کاهش هزینههای استنتاج توسط OpenAI است و از سوی دیگر، مدلهای MiMo شرکت Xiaomi را با کسری ناچیز از قیمت مدلهای تجاری برتر، در جایگاهی نزدیک به آنها نشان میدهد. با این حال، رتبهبندیهای کلی همچنان افت عملکرد در برخی حوزههای تخصصی، رفتارهای مسیردهی مدل (Model Routing) و تفاوتهای فاحش در میزان مصرف توکن را پنهان میکنند.
مدل | شاخص Vals | جایگاه | شاخص هزینه |
|---|---|---|---|
Claude Opus 5.5 | ۶۹٫۶۹٪ | رتبه ۱ از ۶۳ | ۲۲٫۳۰ دلار به ازای هر تست |
GPT-6 Sol | ۶۲٫۶٪ | رتبه ۸ | ۷٫۵۶ دلار به ازای هر تست |
Grok 4.7 | ۶۰٫۲٪ | رتبه ۱۲ | حدود ۲٫۶ برابر Grok 4.6 |
MiMo V2.6 Flash | ۵۹٫۶٪ | پیشتاز در CyberBench | ۰٫۲۰ دلار به ازای هر تست |
MiMo V2.6 Pro | ۵۹٫۵٪ | رتبه ۲ مدلهای وزنباز | ۰٫۳۹ دلار به ازای هر تست |
GPT-6 Luna | ۵۸٫۵٪ | رتبه ۲۰ | ۰٫۴۲ دلار به ازای هر تست |
برتری Opus 5.5 در وظایف ایجنتی به بهای هزینه بالاتر
مدل Claude Opus 5.5 توانست بالاتر از Claude Fable 5.1 (با امتیاز ۶۸٫۸۳ درصد)، Claude Opus 5 (با امتیاز ۶۷٫۲۱ درصد) و GPT-6 Astra (با امتیاز ۶۶٫۶۱ درصد) قرار گیرد. طبق گزارش Vals، این مدل در ۶ جدول ردهبندی مختلف رتبه اول را کسب کرده که از جمله مهمترین آنها میتوان به امتیاز ۶۱٫۶۲ درصد در Terminal-Bench 4.0، امتیاز ۹۱٫۴۳ درصد در MedScribe، امتیاز ۳۷٫۱۳ درصد در شاخص Vals RSI و امتیاز بینقص ۱۰۰ درصد در ProofBench v1.1 اشاره کرد.
در وظیفه آموزش مدل زبانی در «شاخص بهبود خودکار بازگشتی» (Recursive Self-Improvement Index)، مدل Opus 5.5 توانست یک مدل کوچک را در چارچوب بودجه زمانی ۲۴ ساعته آموزش دهد و عملکردی فراتر از خط مبنای انسانی ثبتشده از خود به نمایش بگذارد. در پی این نتیجه، موسسه Vals پیشبینی تاریخ تحقق کامل خودبهبودی بازگشتی را با یک ماه جلو انداختن، به آگوست ۲۰۲۷ تغییر داد. البته این تاریخ حاصل برونیابی از یک تسک آزمایشی و محدود است و به معنای اثبات عینی خودبهبودی بازگشتی بدون محدودیت نیست.
بنچمارک ProgramBench یکی از واضحترین پیشرفتهای این مدل را به نمایش گذاشت؛ جایی که Opus 5.5 موفق شد ۱۸٫۵ درصد از وظایف را بهطور کامل حل کند، در حالی که این رقم برای Fable 5.1 برابر ۷ درصد، برای GPT-6 Astra معادل ۵٫۵ درصد و برای Opus 5 تنها ۳ درصد بود. اجرای این آزمونها ۲٫۴ ساعت طول کشید و ۴۲٫۶۶ دلار به ازای هر وظیفه هزینه در بر داشت.
در مقایسه با Opus 5، مدل جدیدتر میانگین هزینه به ازای هر تست را از ۱۸٫۸۱ دلار به ۲۲٫۳۰ دلار افزایش داده است. علاوه بر این، این مدل در حوزههای MedCode، مزایای عمومی (Public Benefits)، پژوهشهای حقوقی (Legal Research)، بنچمارک Tax Agent و HLAB با افت عملکرد روبهرو شده است که این افت عمدتاً در زمینههای بازیابی اطلاعات، وفاداری به منابع و تطابق با معیارها متمرکز بوده است. همچنین کسب امتیاز ۳٫۷۵ درصد در بنچمارک Legal Agent شرکت Harvey، این مدل را در رتبه ۳۱ از میان ۶۴ مدل قرار داد.
پیچیدگیهای استقرار ناشی از مسیردهی و مصرف توکن
- سازوکارهای امنیتی سمت سرور در شرکت Anthropic، اغلب درخواستهای مرتبط با امنیت سایبری را به مدل Claude Opus 4.8 هدایت میکنند. همچنین درخواستهای حوزه زیستشناسی نیز در صورت احراز هویت نشدن حساب کاربری، به مدل Claude Opus 5 ارجاع داده میشوند. اگر آزمونهایی که با بازگشت به مدلهای دیگر انجام شدهاند را ناموفق در نظر بگیریم، امتیاز ثبتشده در بنچمارک SRE Bench از ۳۳٫۵۹ درصد به ۵٫۳۴ درصد سقوط میکند.
- موسسه تحقیقاتی Artificial Analysis میزان تولید توکن این مدل را حدود ۱۱۹٬۰۰۰ توکن خروجی به ازای هر تسک در شاخص هوش اندازهگیری کرده است، در حالی که این میزان برای Opus 5 حدود ۷۳٬۰۰۰ توکن، برای Fable 5.1 حدود ۷۸٬۰۰۰ توکن و برای GPT-6 Astra نزدیک به ۲۷٬۰۰۰ توکن بوده است. از آنجا که توکنهای تفکر (Thinking Tokens) به عنوان توکن خروجی محاسبه میشوند، قابلیت استدلال تطبیقی همواره فعال مستقیماً در افزایش هزینههای تست این مدل نقش دارد.
کاهش قیمت GPT-6 در عین حفظ نسبی امتیازات قبلی
مدل GPT-6 Sol امتیازی معادل ۶۲٫۶ درصد به دست آورد که تنها یک درصد کمتر از امتیاز ۶۳٫۷ درصدی مدل GPT-5.6 Sol است؛ اما هزینه به ازای هر تست را با ۴۷ درصد کاهش از ۱۴٫۲۱ دلار به ۷٫۵۶ دلار رسانده است. این مدل شاهد بهبود ۷٫۳ درصدی در Vibe Code Bench، رشد ۱۸٫۵ درصدی در Terminal-Bench Science و رشد ۶٫۵ درصدی در Terminal-Bench 4.0 بود، هرچند امتیازات آن در بخشهای پژوهش حقوقی و Tax Agent کاهش یافت.
از سوی دیگر، مدل GPT-6 Luna توانست هزینهها را با ۴۶ درصد کاهش به ۰٫۴۲ دلار به ازای هر تست برساند. این مدل در بنچمارکهای Terminal-Bench، MysteryMechanism و Vibe Code Bench رشد اندکی را ثبت کرد، اما در بخش ایجنت مالی (Finance Agent) با پسرفت جزئی همراه شد. این دو محصول جدید نشان میدهند استراتژی OpenAI به جای ارتقای دقت کلی، بر شیفت دادن منحنی قیمت-عملکرد از طریق کاهش هزینههای استنتاج متمرکز شده است.
رسیدن MiMo به امتیاز ۵۹٫۶ درصد با هزینه ۲۰ سنتی
مدل MiMo V2.6 Flash در شاخص Vals Index با هزینه ۰٫۲۰ دلار برای هر تست (حدود ۱ درصد هزینه Opus 5.5) به امتیاز ۵۹٫۶ درصد رسید. این مدل همچنین با کسب امتیاز ۷۵٫۴ درصد، در صدر بنچمارک CyberBench قرار گرفت.
مدل MiMo V2.6 Pro نیز با امتیاز ۵۹٫۵ درصد، با ۲۷ پله صعود نسبت به رتبه ۴۴ نسخه قبلی (V2.5 Pro) روبهرو شد. بیشترین میزان رشد گزارششده برای این مدل در بنچمارکها به شرح زیر است:
- Vibe Code Bench: ۵۱٫۱ درصد
- ProofBench: ۴۸ درصد
- پژوهش حقوقی (Legal Research): ۳۱٫۲ درصد و دستیابی به رتبه ۱۱
نسخه Pro در حال حاضر با هزینه ۰٫۳۹ دلار به ازای هر تست، در جایگاه دوم مدلهای وزنباز قرار دارد. ترکیب قیمت اقتصادی، دسترسی به وزنهای مدل و امتیازات ارتقایافته در کدنویسی، این مدل را به گزینهای بسیار کاربردی برای خطوط پردازشی با ترافیک بالا تبدیل میکند؛ هرچند ارزیابی آن بر اساس حجم کاری واقعی هر پروژه الزامی خواهد بود.
پیشرفت Grok 4.7 در کدنویسی و افت در اثبات قضایا
مدل Grok 4.7 توانست با صعود از رتبه ۱۹ (نسخه Grok 4.6) به جایگاه دوازدهم جدول دست پیدا کند. امتیاز این مدل در بنچمارک Vibe Code Bench با رشد نزدیک به ۱۰ درصدی به ۸۶٫۲ درصد رسید و در Terminal-Bench 4.0 نیز ۱۱ درصد بهبود یافت و در بنچمارک Legal Agent شرکت Harvey به جایگاه هفتم تکیه زد. با این حال، هزینه هر تست برای این مدل حدود ۲٫۶ برابر Grok 4.6 افزایش یافت و امتیاز آن در ProofBench با افت ۲۵ درصدی روبهرو شد.
تسخیر رتبههای برتر توسط مدلهای تازهنفس
گزارش Vals نشان میدهد ۱۸ مدل از میان ۲۰ مدل برتر جدول طی سه ماه گذشته عرضه شدهاند. بخش عمده پیشرفتهای اخیر در زمینه کدنویسی و استفاده ایجنتی از ابزارها متمرکز بوده است و تغییرات کمتری در آزمونهای دانش عمومی و استدلال به چشم میخورد.
شکاف کلی بین پیشتاز مدلهای تجاری و بهترین نتیجه مدل MiMo تنها حدود ۱۰ واحد درصد است، در حالی که اختلاف هزینه تست آنها از ۱۰۰ برابر فراتر میرود. چنین فاصلهای، فضا را برای ایجاد سیستمهای هیبریدی مهیا میسازد؛ سیستمهایی که کارهای روتین را به مدلهای ارزان هدایت میکنند و مدلهای گرانقیمت را برای وظایف فوقالعاده پیچیده اختصاص میدهند.
پیشنهاد مدلها بر اساس نوع بار کاری
نوع بار کاری | گزینه پیشنهادی برای ارزیابی | دلیل انتخاب |
|---|---|---|
کدنویسی ایجنتی و کارهای ترمینال | Claude Opus 5.5 | پیشتاز در ProgramBench، Terminal-Bench و نتایج مجموع |
خطوط پردازش حقوقی یا مالیاتی | Claude Opus 5 یا Fable 5.1 | افت عملکرد Opus 5.5 در پژوهش حقوقی، مالیات، بازیابی و تطابق با معیارها |
استنتاج اقتصادی با توان پردازشی بالا | MiMo V2.6 Flash | امتیاز مجموع ۵۹٫۶ درصد با هزینه ۰٫۲۰ دلار به ازای هر تست |
استقرار مدلهای وزنباز | MiMo V2.6 Pro | رتبه دوم در میان مدلهای وزنباز با جهش چشمگیر در کدنویسی |
کاهش هزینهها در اکوسیستم OpenAI | GPT-6 Sol یا Luna | کاهش قابل توجه قیمت همراه با حفظ عملکرد نزدیک به نسلهای قبل |
در محیطهای عملیاتی، انتخاب مدل بر اساس این فهرست باید همراه با ارزیابی اختصاصی حجم کاری شامل تأخیر، مصرف توکن، مسیردهی پشتیبان (Fallback)، دقت بازیابی و انطباق با قواعد صورت پذیرد؛ زیرا این عوامل میتوانند برتری ظاهری حاصل از یک امتیاز تکبعدی را دگرگون کنند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.