پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل Claude Opus 5.5 جایگاه نخست شاخص هوشمندی را از آن خود کرد

انتشار:۳۱ شهریور ۱۴۰۵(۵ روز پیش)
۳ دقیقه زمان مطالعه
۰ دیدگاه

مدل جدید Opus شرکت Anthropic با کسب امتیاز بی‌سابقه ۵۸، همراه با کاهش ۲۰ درصدی قیمت و تخفیف ویژه برای پردازش‌های مبتنی بر حافظه پنهان منتشر شد.

مدل Claude Opus 5.5 جایگاه نخست شاخص هوشمندی را از آن خود کرد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل Claude Opus 5.5 عملکرد قدرتمندی ثبت کرده و در ارزیابی‌های کلیدی از رقبای سرسخت خود پیشی گرفته است.
  • این مدل در پردازش‌های پیشرفته ایجنت‌ها با ثبت بالاترین امتیاز، از GPT-5.6 سبقت گرفته است.
  • به‌رغم افزایش توانمندی‌ها، هزینه استفاده از این مدل نسبت به نسخه قبلی کاهش قابل‌توجهی یافته است.

مدل Claude Opus 5.5 جایگاه نخست شاخص هوشمندی را به دست آورد؛ کاهش ۲۰ درصدی قیمت و تخفیف بیشتر کش

مدل Claude Opus 5.5 شرکت Anthropic را در ارزیابی‌هایی نظیر Terminal-Bench 4.0 و AutomationBench با مدل GPT-6 Astra هم‌تراز می‌کند و همزمان پیشتازی این شرکت در کارهای دانشی ایجنت‌ها (agentic knowledge work) را گسترش می‌دهد.

در بالاترین سطح تلاش (max effort)، این مدل امتیاز ۵۸ را در شاخص هوشمندی کسب کرد که بالاترین امتیاز ثبت‌شده با اختلاف چند نمره است. شرکت Anthropic قیمت مدل Opus را به ۴ و ۲۰ دلار به ازای هر یک میلیون توکن ورودی و خروجی کاهش داده (نسخه قبلی ۵ و ۲۵ دلار بود) و هزینه خواندن از کش نیز از ۰.۵۰ دلار به ۰.۲۰ دلار رسیده است.

نکات کلیدی:

➤ عملکرد قدرتمند و پایدار با برتری در شش ارزیابی از ده ارزیابی شاخص هوشمندی: آزمون Humanity's Last Exam با ۶۱.۴ درصد (بهترین رکورد قبلی ۵۹.۱ درصد برای Claude Fable 5.1)، آزمون SciCode با ۶۶.۹ درصد، و همچنین آزمون‌های GDPval، Briefcase، Omniscience و AutomationBench. در Terminal-Bench 4.0 امتیاز ۵۹.۶ درصد را کسب کرده که هم‌سطح با پیشگام این بخش یعنی GPT-6 Astra است و ۱۱ نمره بالاتر از Opus 5 قرار می‌گیرد. با این حال، در بخش‌های CritPt، LCR و GDP.pdf همچنان عقب‌تر است.

➤ پیشتاز در کارهای دانشی ایجنت‌ها: در آزمون Briefcase که ارزیابی دانش پیشرفته ایجنت‌ها است، به امتیاز الو (Elo) ۱۸۲۲ دست یافت. این رقم ۱۴۳ نمره بالاتر از Fable 5.1 بوده و در هر دو بخش کیفیت تحلیلی و ارائه برتر است. این نخستین بار است که Anthropic از نظر کیفیت ارائه توانسته از GPT-5.6 سبقت بگیرد. این ارزیابی بررسی می‌کند که آیا مدل‌ها می‌توانند خروجی‌های حرفه‌ای، دقیق و با ساختار مناسب تولید کنند یا خیر.

➤ برابری هزینه هر کار با Opus 5 به‌رغم افزایش ۱.۶ برابری توکن‌های خروجی: مدل Claude Opus 5.5 (حالت max) برای هر وظیفه در شاخص هوشمندی حدود ۱۱۹ هزار توکن خروجی مصرف می‌کند، در حالی که این رقم برای Opus 5 حدود ۷۳ هزار، برای Fable 5.1 حدود ۷۸ هزار و برای GPT-6 Astra تنها ۲۷ هزار توکن است.

➤ چهار مورد از پنج سطح تلاش در مرز هوشمندی در برابر هزینه قرار دارند: سطوح max، xhigh، high و medium در Opus 5.5 همگی در مرز پارتو (Pareto frontier) جای گرفته‌اند که به معنای هزینه کمتر یا عملکرد بهتر نسبت به سایر مدل‌های بالای ۵۰ امتیاز (نظیر GPT-6 Astra، Claude Fable 5.1 و Claude Opus 5) است.

سایر جزئیات مدل:

➤ پنجره زمینه (Context Window): پشتیبانی از یک میلیون توکن زمینه برای ورودی‌های متنی و تصویری که نسبت به Opus 5 بدون تغییر مانده است.

➤ قیمت‌گذاری: ۴ و ۲۰ دلار برای هر یک میلیون توکن ورودی/خروجی، که نسبت به ۵ و ۲۵ دلار در Opus 5 شاهد ۲۰ درصد کاهش است. نوشتن در حافظه پنهان (Cache writes) برای ماندگاری ۵ دقیقه‌ای به ۵ دلار در هر یک میلیون توکن رسیده (از ۶.۲۵ دلار). خواندن از کش باز هم تخفیف بیشتری خورده و با ۶۰ درصد کاهش نسبت به Opus 5 به ۰.۲۰ دلار رسیده است. این یعنی ۹۵ درصد تخفیف نسبت به توکن‌های ورودی بدون کش، در حالی که این تخفیف در مدل‌های قبلی Opus حدود ۹۰ درصد بود.

➤ تنظیمات سطح تلاش: پنج تنظیم مختلف (low، medium، high، xhigh و max). تمامی ارزیابی‌های شاخص هوشمندی در این پنج سطح انجام شده است.

چهار مورد از پنج سطح تلاش مدل Claude Opus 5.5 در مرز هوشمندی بهینه نسبت به هزینه قرار دارند. این سطوح هزینه کمتری داشته یا از سایر مدل‌های برتر عملکرد بهتری نشان می‌دهند.

مدل Claude Opus 5.5 (در حالت max) در زمینه کارهای دانشی ایجنت‌ها بهترین عملکرد را دارد. این مدل با امتیاز ۱۸۲۲ در Briefcase و امتیاز ۱۸۴۶ در GDPval پیشتاز است. همچنین در بخش کیفیت تحلیل و ارائه نیز رتبه نخست را در اختیار دارد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر