پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی آنتروپیک از Claude Sonnet 5.5؛ عملکرد نزدیک به پرچمدار با ۳۰ درصد هزینه کمتر!

انتشار:۶ مهر ۱۴۰۵(۱ ساعت پیش)
۸ دقیقه زمان مطالعه
۰ دیدگاه

شرکت آنتروپیک از مدل Claude Sonnet 5.5 رونمایی کرد؛ مدلی میان‌رده که فاصله‌اش را با برادر بزرگ‌تر و بسیار گران‌قیمتش، Opus 5.5، به حداقل رسانده است. این مدل با کاهش استپ‌های کاری و فراخوانی ابزارها، انجام پروژه‌ها را تا ۳۰ درصد ارزان‌تر و سریع‌تر می‌کند.

رونمایی آنتروپیک از Claude Sonnet 5.5؛ عملکرد نزدیک به پرچمدار با ۳۰ درصد هزینه کمتر!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • آنتروپیک از مدل Claude Sonnet 5.5 رونمایی کرد؛ مدلی چابک و میان‌رده که در بنچمارک‌های کلیدی شانه به شانه پرچمدار گران‌قیمت این شرکت یعنی Opus 5.5 حرکت می‌کند.
  • با اینکه قیمت پایه هر توکن تغییری نکرده، اما به لطف سرعت ۳۰ درصد بالاتر و فراخوانی کمتر ابزارها، هزینه نهایی انجام هر تسک تا ۳۰ درصد ارزان‌تر تمام می‌شود.
  • آزمایش شرکت‌هایی مثل اسلک، باکس و زندسک نشان می‌دهد ایجنت‌های هوش مصنوعی با این مدل استپ‌های کمتر و خطاهای به مراتب پایین‌تری را ثبت کرده‌اند.

شرکت آنتروپیک رسماً از مدل Claude Sonnet 5.5 رونمایی کرد؛ یک به‌روزرسانی چابک، پرسرعت و بهینه برای مدل میان‌رده و پرکاربرد این شرکت که وظایف سنگین روزمره را بر دوش می‌کشد.

در آزمایش‌های مختلف آنتروپیک، عملکرد Sonnet 5.5 به‌شکل شگفت‌انگیزی به غول گران‌قیمت این شرکت یعنی Opus 5.5 (که پرچمدار تازه آنتروپیک است و هفته گذشته معرفی شد) نزدیک شده است. این موضوع به کسب‌وکارها و شرکت‌ها یک جایگزین فوق‌العاده می‌دهد تا بدون پرداخت هزینه‌های سرسام‌آور مدل‌های پرچمدار مرزی، به قدرتی مشابه دسترسی داشته باشند.

آنتروپیک می‌گوید خروجی Sonnet 5.5 بیش از ۳۰ درصد سریع‌تر از Sonnet 5 تولید می‌شود و می‌تواند هزینه کلی انجام هر تسک و پروژه را تا ۳۰ درصد پایین بیاورد. نکته جالب اینجاست که این کاهش هزینه به خاطر ارزان‌تر شدن قیمت برچسب API نیست، بلکه به دلیل تولید توکن‌های کمتر و فراخوانی کمتر ابزارها (Tool Calls) در حین انجام کار اتفاق می‌افتد.

آنتروپیک قیمت پایه رابط کاربری (API) مدل Sonnet 5.5 را دقیقاً مانند نسخه قبلی یعنی Sonnet 5 نگه داشته است: ۲ دلار برای هر ۱ میلیون توکن ورودی و ۱۰ دلار برای هر ۱ میلیون توکن خروجی، به همراه تخفیف ۰.۲۰ دلاری برای خواندن کش داده‌ها. ذخیره اطلاعات در کش نیز ۲.۵۰ دلار به ازای هر ۱ میلیون توکن هزینه دارد.

برای مقایسه، جالب است بدانید مدل پرچمدار Opus 5.5 به ازای هر ۱ میلیون توکن ورودی ۴ دلار و برای هر ۱ میلیون توکن خروجی ۲۰ دلار قیمت دارد و هزینه نوشتن کش آن ۵ دلار است.

به زبان ساده، استراتژی و مانور اصلی آنتروپیک دیگر روی قیمت خام تک‌تک توکن‌ها نیست؛ بلکه تمرکز اصلی روی «هزینه واقعی تموم کردن یک کار» قرار گرفته است.

آنتروپیک قدرت Opus را به کالبد Sonnet تزریق می‌کند

آنتروپیک مدل Sonnet 5.5 را گزینه‌ای ایده‌آل برای کارهای مشخص و روزمره مثل عیب‌یابی نرم‌افزار، کدنویسی، تولید اسناد و محتوا، ساخت پرزنتیشن، کار با صفحات گسترده و طراحی یا بهبود رابط کاربری توصیف می‌کند. در سوی مقابل، Opus 5.5 همچنان انتخاب اصلی برای پروژه‌های پیچیده، مبهم و بی‌پایانی است که نیازمند قضاوت عمیق و مداوم هستند.

با این حال، نتایج ارزیابی‌های خود آنتروپیک نشان می‌دهد که شکاف بین این دو دسته در بسیاری از کاربری‌ها حسابی باریک شده است.

در بنچمارک GDPval-AA که عملکرد مدل‌ها را در تسک‌های شغلی واقعی می‌سنجد، Sonnet 5.5 به امتیاز شگفت‌انگیز ۱۸۴۴ رسیده است؛ امتیازی که تقریباً تفاوتی با امتیاز ۱۸۴۶ مدل Opus 5.5 ندارد و فرسنگ‌ها جلوتر از امتیاز ۱۴۴۹ مدل قبلی Sonnet 5 قرار گرفته است. در آزمون AA-Briefcase نیز Sonnet 5.5 امتیاز ۱۸۱۱ را ثبت کرده که بسیار نزدیک به امتیاز ۱۸۲۲ مدل Opus 5.5 است.

این مدل جدید در بنچمارک کنترل کامپیوتر OSWorld 2.1 موفق به کسب امتیاز ۸۰.۱ درصد شده که شانه به شانه ۸۱.۸ درصد در Opus 5.5 حرکت می‌کند و جهش چشمگیری نسبت به ۵۷ درصد نسخه قبلی دارد. در آزمون تشخیص بصری نمودارها (Chartography) هم نمره ۶۱.۶ درصد را ثبت کرده، در حالی که Opus 5.5 نمره ۶۴.۴ درصد و مدل قدیمی Sonnet 5 تنها نمره ۱۵.۶ درصد گرفته بودند.

آنتروپیک تأکید ویژه‌ای روی توانایی کدنویسی این مدل دارد. در بنچمارک معروف کدنویسی ایجنت‌ها یعنی Terminal-Bench 4.0، مدل Sonnet 5.5 رکورد درخشان ۷۰.۶ درصد را بر جای گذاشته؛ مقداری که حتی بالاتر از ۶۶.۴ درصد مدل Opus 5.5 و چندین برابر ۱۰.۳ درصد مدل قبلی است! در آزمون CursorBench 4.0 هم به امتیاز ۵۵.۵ درصد رسیده که فاصله ناچیزی با ۵۷.۸ درصد مدل پرچمدار دارد.

البته نباید بنچمارک‌ها را متر و معیار مطلق برای همه پروژه‌های واقعی دانست و خود آنتروپیک هم اذعان دارد که Opus 5.5 برای کارهای غامض و بی‌پایان دست بالاتر را دارد.

اما در دنیای تجارت، صرفه اقتصادی اغلب مهم‌تر از رتبه‌بندی‌های تئوریک روی کاغذ است.

آنتروپیک اعلام کرده در چندین بررسی مختلف، اجرای Sonnet 5.5 در حالت تفکر «کم یا متوسط» (Low or Medium effort) می‌تواند بهترین نتیجه Sonnet 5 را با تنها یک‌دهم هزینه به ازای هر تسک پشت سر بگذارد! در آزمون FrontierCode نیز این مدل در حالت High حدود ۱۰ امتیاز بالاتر از نسخه قبلی می‌گیرد، در حالی که هزینه‌اش به ازای هر تسک حدوداً یک‌پانزدهم است.

ابزار کدنویسی Claude Code و اپلیکیشن‌های مصرف‌کننده آنتروپیک به‌صورت پیش‌فرض روی حالت تلاش Medium کار خواهند کرد، در حالی که پلتفرم توسعه‌دهندگان Claude روی High تنظیم خواهد بود. در حالت‌های پایین‌تر، عمق استدلال کمی کاهش می‌یابد تا سرعت بالا برود و مصرف توکن به حداقل برسد؛ اما در حالت‌های بالاتر، مدل وقت بیشتری را صرف بررسی مجدد و اصلاح کارهای خود می‌کند.

گزارش مشتریان سازمانی: استپ‌های کمتر و ایجنت‌های سریع‌تر

نتایج آزمایش‌های اولیه در شرکت‌های بزرگ فناوری، تصویر ملموس‌تری از معنای این بهینه‌سازی‌ها در جریان‌های کاری واقعی نشان می‌دهد.

یاشودا باوناانی، معاون محصولات هوش مصنوعی در شرکت باکس (Box)، می‌گوید Sonnet 5.5 مدارک مرجع را مجدداً بازبینی کرده و خطاهایی را پیدا کرده که نسخه قبلی متوجه آن‌ها نشده بود:

«در مقایسه با نسخه قبل، Sonnet 5.5 بسیار دقیق‌تر بود، ۲.۴ برابر سرعت بیشتری داشت و در مجموع ۱۲ درصد توکن کمتری مصرف کرد.»

پلتفرم زندسک (Zendesk) هم این مدل را روی صدها تیکت پشتیبانی و پاسخ به مشتریان تست کرد. ابینای کاتوریا، مدیر هوش مصنوعی زندسک، اعلام کرد تیکت‌ها ۲۰ درصد سریع‌تر بررسی شدند و مدل تصمیمات نادرست به مراتب کمتری نسبت به نسخه‌های قبلی گرفت.

تیم اسلک (Slack) نیز وضعیت مشابهی را گزارش کرده است. کورتیس آلن، مهندس ارشد اسلک، می‌گوید Sonnet 5.5 در ارزیابی‌های ربات Slackbot بدون حتی یک تغییر در پرامپت‌ها، عملکرد بهتری نسبت به نسخه قبلی نشان داد و ضمن نیاز به مراحل و استپ‌های کمتر، حدود ۱۴ درصد توکن خروجی کمتری مصرف کرد.

این کاهش مراحل برای ایجنت‌های کدنویسی فوق‌العاده حیاتی است. فابیان هدین، هم‌بنیان‌گذار و مدیر ارشد فناوری Lovable، گزارش داده که این مدل جدید برای اتمام کارهای برنامه‌نویسی به یک‌سوم فراخوانی ابزار کمتر و تقریباً نصف دستورات خط فرمان نیاز داشته است.

همچنین پلتفرم Base44 متوجه شد در ۱۱۸ پروژه واقعی ساخت اپلیکیشن، مدل Sonnet 5.5 به‌طور میانگین تنها با ۳.۶ چرخه و تلاش به ازای هر ساخت به نتیجه‌ای معادل Opus 5 رسید (در مقایسه با ۷.۷ بار تلاش برای Opus 5) و کمترین شکست در اجرای ابزارها را بین تمامی مدل‌های مورد مقایسه به ثبت رساند.

این آمارها یک حقیقت مهم را به شرکت‌ها گوشزد می‌کند: قیمت توکن‌ها فقط نیمی از ماجراست. هر ابزار غیرضروری، هر اقدام ناموفق و هر بار تلاش مجدد، مستقیماً تأخیر زمانی، هزینه سرور و خطر خارج شدن ایجنت‌های خودکار از مسیر اصلی را افزایش می‌دهد.

جنگ قیمت مدل‌های پرچمدار روزمره به اوج می‌رسد

ورود Sonnet 5.5 درست در شرایطی اتفاق افتاده که بازار مدل‌های سطح بالای اقتصادی به‌شدت رقابتی و داغ شده است.

هفته گذشته اوپن‌ای‌آی از GPT-6 Sol رونمایی کرد که قیمتی مشابه Sonnet 5.5 دارد (۲ دلار ورودی و ۱۰ دلار خروجی) و با پنجره کانتکست ۱.۰۵ میلیون توکنی، تمرکز ویژه‌ای روی کدنویسی پیچیده و ایجنت‌ها گذاشته است.

از سوی دیگر گوگل با مدل Gemini 3.8 Flash بازی قیمت‌ها را به هم زده و آن را تا پایان سال ۲۰۲۶ با قیمت شگفت‌انگیز ۰.۷۵ دلار ورودی و ۳.۷۵ دلار خروجی عرضه می‌کند (که البته در سال ۲۰۲۷ به ۱.۵۰ و ۷.۵۰ دلار افزایش می‌یابد).

همچنین آزمایشگاه هوش مصنوعی شیائومی اخیراً مدل‌های MiMo-V2.6-Pro و نسخه Flash را تحت مجوز متن‌باز MIT منتشر کرد؛ به این معنی که شرکت‌ها و توسعه‌دهندگان می‌توانند این مدل‌ها را رایگان دانلود کرده و بدون پرداخت یک ریال به شیائومی، آن‌ها را شخصی‌سازی کنند. در قالب سرویس ابری هم این مدل‌ها جزو ارزان‌ترین گزینه‌های هوش مصنوعی در دنیا به شمار می‌روند.

مدل

ورودی (دلار/۱M)

خروجی (دلار/۱M)

مجموع (دلار/۱M)

توسعه‌دهنده

Muse Spark 1.2 / 1.3 Contributor

$0.10

$0.20

$0.30

Meta

MiMo-V2.6-Flash

$0.14

$0.28

$0.42

Xiaomi

GPT-6 Luna

$0.10

$0.50

$0.60

OpenAI

DeepSeek-V4.1-Flash — ساعات خلوت

$0.15

$0.60

$0.75

DeepSeek

MiMo-V2.6-Pro

$0.435

$0.87

$1.305

Xiaomi

MiniMax-M3

$0.30

$1.20

$1.50

MiniMax

LongCat-2.0 — تخفیف ویژه

$0.30

$1.20

$1.50

LongCat

DeepSeek-V4.1-Flash — ساعات پیک

$0.30

$1.20

$1.50

DeepSeek

DeepSeek-V4-Pro — ساعات خلوت

$0.66

$1.98

$2.64

DeepSeek

LongCat-2.0 — استاندارد

$0.75

$2.95

$3.70

LongCat

Gemini 3.7 Flash — تا پایان ۲۰۲۶

$0.75

$3.75

$4.50

Google

Gemini 3.8 Flash — تا پایان ۲۰۲۶

$0.75

$3.75

$4.50

Google

DeepSeek-V4-Pro — ساعات پیک

$1.32

$3.96

$5.28

DeepSeek

Muse Spark 1.1 / 1.2 / 1.3

$1.25

$4.25

$5.50

Meta

GLM-5.3

$1.40

$4.40

$5.80

Z.AI

Grok 4.7 — زیر ۲۰۰ هزار توکن

$2.00

$6.00

$8.00

xAI

Qwen3.8-Max

$2.00

$6.00

$8.00

QwenCloud

Gemini 3.7 Flash — از سال ۲۰۲۷

$1.50

$7.50

$9.00

Google

Gemini 3.8 Flash — از سال ۲۰۲۷

$1.50

$7.50

$9.00

Google

GPT-6 Sol

$2.00

$10.00

$12.00

OpenAI

Claude Sonnet 5.5

$2.00

$10.00

$12.00

Anthropic

Grok 4.7 — بالای ۲۰۰ هزار توکن

$4.00

$12.00

$16.00

xAI

Grok 4.7 Fast (Cursor) — زیر ۲۵۶ هزار توکن

$4.00

$12.00

$16.00

Cursor

GPT-5.4

$2.50

$15.00

$17.50

OpenAI

Kimi K3

$3.00

$15.00

$18.00

Moonshot AI

Claude Opus 5.5

$4.00

$20.00

$24.00

Anthropic

Grok 4.7 Fast (Cursor) — بالای ۲۵۶ هزار توکن

$6.00

$18.00

$24.00

Cursor

Sakana Fugu Ultra

$5.00

$30.00

$35.00

Sakana AI

Claude Opus 5.5 — حالت سریع

$8.00

$40.00

$48.00

Anthropic

Claude Fable 5 / Claude Mythos 5

$10.00

$50.00

$60.00

Anthropic

Claude Fable 5.1 / Claude Mythos 5.1

$10.00

$50.00

$60.00

Anthropic

GPT-6 Astra — حالت استاندارد

$10.00

$50.00

$60.00

OpenAI

GPT-6 Astra — حالت سریع

$20.00

$100.00

$120.00

OpenAI

تمام این شواهد نشان می‌دهد که آنتروپیک قصد ندارد این راند از مسابقه را صرفاً با برچسب قیمتی ارزان‌تر ببرد؛ در عوض، برگ برنده Sonnet 5.5 مفهوم «بهره‌وری حداکثری» است: مدلی که وظیفه را با استپ‌های فکری کمتر، توکن‌های کمتر و درخواست‌های ابزاری محدودتر انجام می‌دهد و در نتیجه صورت‌حساب نهایی شرکت‌ها را سبک‌تر می‌کند.

قابلیت‌های سایبری قدرتمندتر با محدودیت‌های سفت‌وسخت‌تر

این جهش عملکردی بدون تغییرات ایمنی نبوده است: Sonnet 5.5 نخستین مدل در سری سونت به شمار می‌رود که با تدابیر امنیتی سایبری مشابه پیشرفته‌ترین سیستم‌های آنتروپیک مجهز شده است.

آنتروپیک اعلام کرده کارهای روزمره برنامه‌نویسی و ترمیم آسیب‌پذیری‌ها طبق روال عادی انجام خواهد شد، اما درخواست‌های سایبری با ریسک بالا به‌صورت خودکار به مدل ضعیف‌تر Sonnet 5 هدایت می‌شوند. این شرکت قصد دارد برنامه تأیید صلاحیت سایبری خود را گسترش دهد تا متخصصان و مدافعان امنیتی مجاز بتوانند به قابلیت‌های سطح بالاتر در مدل‌های Sonnet 5.5، Opus 5.5 و خانواده Mythos دسترسی داشته باشند.

علاوه بر این، آنتروپیک تدابیر محافظتی جدیدی برای جلوگیری از «حملات تقطیر مدل» (Model Distillation Attacks) به کار گرفته است؛ حملاتی که در آن‌ها مهاجمان سعی می‌کنند با پرامپت‌گذاری انبوه و سازمان‌یافته، قابلیت‌های مدل را کپی و بازتولید کنند. البته منتقدان خاطرنشان می‌کنند خود شرکت‌هایی مثل آنتروپیک مدل‌هایشان را با حجم عظیمی از داده‌های وب و بدون رضایت صریح تولیدکنندگان آموزش داده‌اند و اکنون ادعای انحصار کامل بر خروجی‌ها کمی متناقض به نظر می‌رسد.

مدل Sonnet 5.5 نخستین عضو این خانواده است که به طبقه‌بندی‌کننده‌هایی برای ممانعت از استخراج زنجیره تفکر مجهز شده است و سیستم «تفکر حفاظت‌شده» آن به نحوی طراحی شده که ردپای تفکر مدل از اکانت ایجادکننده جدا نشود. حفاظت‌های مربوط به مخاطرات زیستی نیز مانند نسخه قبل پابرجا مانده‌اند.

در دسترس در تمام پلتفرم‌های ابری بزرگ

مدل هوش مصنوعی Claude Sonnet 5.5 علاوه بر پلتفرم رسمی آنتروپیک، روی خدمات ابری آمازون (AWS)، گوگل کلاد (Google Cloud) و مایکروسافت آژور (Azure) با تضمین عدم نگهداری داده‌ها (Zero Data Retention) عرضه می‌شود. توسعه‌دهندگان می‌توانند از طریق شناسه claude-sonnet-5-5 به این مدل دسترسی پیدا کنند.

آنتروپیک همچنین وعده داده که مدل اقتصادی Claude Haiku 5.5 که مخصوص پردازش حجم‌های کاری بسیار بالا و فوق‌العاده حساس به قیمت است، طی هفته‌های آینده از راه خواهد رسید.

اما برای شرکت‌ها و توسعه‌دهندگان تجاری، Sonnet 5.5 احتمالاً سرنوشت‌سازترین عضو این خانواده است؛ نه به این خاطر که آنتروپیک نرخ API را شدیداً پایین آورده، بلکه به این دلیل که مدل میان‌رده خود را به اندازه‌ای توانا و پخته کرده که دیگر نیازی به خرید مدل‌های فوق‌لوکس و گران‌قیمت نخواهند داشت.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

چت‌جی‌پی‌تی زیر تیغ قانون؛ ایالت‌های آمریکا چطور دست‌وپای OpenAI را می‌بندند؟
آخرین اخبار

چت‌جی‌پی‌تی زیر تیغ قانون؛ ایالت‌های آمریکا چطور دست‌وپای OpenAI را می‌بندند؟

اگرچه مسدودسازی کامل چت‌جی‌پی‌تی در سراسر یک ایالت بعید به نظر می‌رسد، اما ایالت‌های آمریکا ابزارهای حقوقی قدرتمندی برای مهار هوش مصنوعی دارند. از شکایت جنجالی فلوریدا علیه سم آلتمن گرفته تا قوانین سفت‌وسخت کالیفرنیا برای نوجوانان، حالا قانون‌گذاران محلی دست‌به‌کار شده‌اند تا مرزهای فعالیت چت‌بات‌ها را مشخص کنند.

۳ دقیقه مطالعه
۰
۶ مهر
احضار جنجالی ایلان ماسک به شورای شهر نیویورک؛ پای رسوایی‌های چتبات Grok و خطرات هوش مصنوعی در میان است!
آخرین اخبار

احضار جنجالی ایلان ماسک به شورای شهر نیویورک؛ پای رسوایی‌های چتبات Grok و خطرات هوش مصنوعی در میان است!

شورای شهر نیویورک رسماً ایلان ماسک و غول تازه‌نفس ۲ تریلیون دلاری SpaceXAI را برای ادای توضیحات درباره خطرات امنیتی هوش مصنوعی احضار کرد. این بازپرسی بی‌سابقه پس از جنجال‌های گسترده چتبات Grok در تولید تصاویر دیپ‌فیک غیراخلاقی و گزارش‌هایی از خرابکاری ایجنت‌های سرکش هوش مصنوعی در پایگاه‌های داده کلید خورده است.

۲ دقیقه مطالعه
۰
۶ مهر
پشت‌پرده رقابت داغ انویدیا و اوپن‌ای‌آی؛ ماجرای پیشنهاد مخفیانه ۱۰۰ میلیون دلاری به هاگینگ فیس چیست؟
آخرین اخبار

پشت‌پرده رقابت داغ انویدیا و اوپن‌ای‌آی؛ ماجرای پیشنهاد مخفیانه ۱۰۰ میلیون دلاری به هاگینگ فیس چیست؟

گزارش‌های تازه نشون میده پیش از نهایی شدن قرارداد ۱۳ میلیارد دلاری انویدیا برای تصاحب هاگینگ فیس، اوپن‌ای‌آی هم قصد داشته با سرمایه‌گذاری ۱۰۰ میلیون دلاری پای تراشه‌های اختصاصی خودش رو به این پلتفرم باز کنه. این پیشنهاد زنگ خطر رو برای انویدیا به صدا درآورد و باعث شد جنسن هوانگ با تمام قوا وارد میدون بشه و بزرگ‌ترین معامله تاریخ هوش مصنوعی منبع‌باز رو رقم بزنه.

۳ دقیقه مطالعه
۰
۶ مهر