پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار کم‌خرج آنتروپیک: کلود هایکو ۵.۵ با هزینه باورنکردنی ۲۴ دلار همه رقبا را جا گذاشت!

انتشار:۱۸ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه
اشتراک و پسندیدن

مدل چابک و جمع‌وجور کلود هایکو ۵.۵ (Claude Haiku 5.5) موفق شد با عملکرد درخشان و هزینه باورنکردنی ۲۴.۳ دلار به ازای هر ۱۰۰۰ کوئری، در صدر جدول بهره‌وری اقتصادی بنچمارک Parallel قرار بگیرد. این مدل با اختلافی اندک نسبت به برادر بزرگ‌تر و فوق‌العاده گران‌قیمت خود یعنی کلود اوپوس، هزینه‌ها را تا یک‌سی‌ونهم کاهش داده است. این جهش خیره‌کننده نشان می‌دهد که توسعه‌دهندگان می‌توانند با بودجه‌ای بسیار اقتصادی، ایجنت‌های هوش مصنوعی فوق‌العاده قدرتمندی برای جستجو و وب‌گردی بسازند.

شاهکار کم‌خرج آنتروپیک: کلود هایکو ۵.۵ با هزینه باورنکردنی ۲۴ دلار همه رقبا را جا گذاشت!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل کلود هایکو ۵.۵ با ثبت امتیاز ۶۲.۹ و هزینه شگفت‌انگیز ۲۴.۳ دلار به ازای هر ۱۰۰۰ تسک، در رتبه نخست بهینه‌ترین مدل‌های وب‌محور بنچمارک Parallel قرار گرفت.
  • برای مقایسه، مدل پرچمدار کلود اوپوس ۵.۵ با امتیاز ۷۵.۴ هزینه‌ای معادل ۹۴۹ دلار دارد؛ یعنی هایکو با تنها ۱۲.۵ امتیاز اختلاف، ۳۹ برابر ارزان‌تر از آب درمی‌آید!
  • این دستاورد به لطف نرخ توکن فوق‌العاده پایین (۱۰ سنت ورودی و ۵۰ سنت خروجی در میلیون توکن) و امکان تنظیم سطح تفکر محقق شده و هایکو ۵.۵ را به گزینه‌ای ایده‌آل برای پایپ‌لاین‌های ایجنتی تبدیل کرده است.

صدرنشینی کلود هایکو ۵.۵ در بهره‌وری جستجو با هزینه ۲۴.۳۰ دلار به ازای هر ۱۰۰۰ تسک

مدل جمع‌وجور و کم‌خرج شرکت آنتروپیک، یعنی کلود هایکو ۵.۵ (Claude Haiku 5.5) موفق شده در جدول رتبه‌بندی وب‌سایت Parallel از نظر بهره‌وری هزینه در جایگاه نخست بایستد. این مدل در تسک‌های استدلال مبتنی بر وب (Web-Grounded Reasoning) امتیاز ۶۲.۹ را ثبت کرد؛ آن هم با هزینه تخمینی فقط ۲۴.۳۰ دلار به ازای هر ۱۰۰۰ پرسش! جالب اینجاست که قدرتمندترین مدل کل جدول یعنی کلود اوپوس ۵.۵ (Claude Opus 5.5)، امتیاز ۷۵.۴ را با هزینه سنگین ۹۴۹ دلار به ازای هر ۱۰۰۰ تسک به دست آورده است؛ یعنی هایکو با تنها ۱۲.۵ امتیاز اختلاف، هزینه‌ها را تا یک‌سی‌ونهم کاهش داده است!

شرکت Parallel که در زمینه ارائه API جستجو فعالیت دارد، نتایج این ارزیابی را در دو بخش منتشر می‌کند: بخش «هوش جستجو» (Search Intelligence) که کیفیت پاسخ مدل در صورت دسترسی به ابزار‌های وب را می‌سنجد، و بخش «بهره‌وری جستجو» (Search Efficiency) که مدل‌های با امتیاز بالا‌تر از خط میانه (۶۲.۸) را بر اساس هزینه تخمینی رتبه‌بندی می‌کند. هایکو ۵.۵ توانسته با اختلاف ۰.۱ امتیاز از این حد نصاب عبور کند و با هزینه‌ای کم‌تر از تمام مدل‌های واجد شرایط دیگر، صدر جدول را تصاحب نماید.

آزمونی با ۱۰۰ پرسش چالش‌برانگیز و ابزار‌های مشخص

در این آزمون، هر مدل به ۱۰۰ سوال متنوع از سه مجموعه ارزیابی معتبر پاسخ می‌دهد؛ یک‌بار با استفاده از ابزار‌های جستجوی Parallel و یک‌بار هم بدون آن‌ها. این مجموعه‌ها شامل DeepSearchQA متعلق به گوگل (برای ارزیابی تحقیقات چندمرحله‌ای)، بنچمارک دشوار Humanity's Last Exam (شامل سوالات طراحی‌شده توسط متخصصان که نیازمند شواهد موثق از وب هستند) و در نهایت بنچمارک WISER شرکت Parallel (با تمرکز روی تحقیقات دنیای کسب‌وکار) است.

تیم Parallel برای اینکه مقایسه‌ای کاملاً عادلانه رقم بزند، بودجه ابزار‌های در دسترس را ثابت نگه داشته و اجرای کد را هم غیرفعال کرده است تا تمرکز ارزیابی صرفاً روی توانمندی مدل و سیستم بازیابی اطلاعات (Retrieval) باشد. بنابراین امتیاز به‌دست‌آمده نشان‌دهنده عملکرد مدل در همین ساختار مشخص است، نه معیاری کلی برای سنجش کیفیت در کار‌هایی مثل برنامه‌نویسی، نویسندگی یا سایر تسک‌ها.

معیار «جهش عملکرد» (Lift) اختلاف امتیاز مدل در دو حالت با جستجو و بدون جستجو را نشان می‌دهد. امتیاز هایکو ۵.۵ از ۲۳.۵ در حالت بدون جستجو، پس از فعال شدن قابلیت سرچ به ۶۲.۹ رسید که جهش چشمگیر ۳۹.۴ امتیازی را نشان می‌دهد. این پرش قابل‌توجه ثابت می‌کند که بازیابی دقیق اطلاعات و هماهنگی هوشمندانه در جستجو، نقشی حیاتی در درخشش این مدل داشته است.

تنها ۱۲ امتیاز فاصله میان ۲۴ دلار و ۹۴۹ دلار!

مدل
امتیاز
هزینه مدل به ازای هر ۱۰۰۰ تسک
Claude Opus 5.5
۷۵.۴
۹۴۹ دلار
Claude Fable 5.1
۷۲.۷
۱۶۵۵ دلار
Pareto 26.9
۷۲.۵
۱۸۴ دلار
GPT-6 Astra
۷۰.۸
۴۰۱ دلار
GPT-6.1 Sol
۷۰.۴
۱۳۰ دلار
Claude Haiku 5.5
۶۲.۹
۲۴.۳۰ دلار

مدل MiMo v2.6 Pro شیائومی با نرخ ۷۶.۵۰ دلار به ازای هر ۱۰۰۰ تسک، دومین گزینه ارزان‌قیمت بالا‌تر از خط میانه است؛ رقمی که با وجود به‌صرفه بودن، بیش از سه برابر گران‌تر از هایکو تمام می‌شود. از سوی دیگر، کلود سونت ۵ (Claude Sonnet 5) با رشد خیره‌کننده ۴۳.۸ امتیازی پس از فعال شدن بازیابی اطلاعات، بالا‌ترین جهش جستجو را در میان تمامی مدل‌ها به نام خود ثبت کرد.

نرخ پایین توکن‌ها؛ برگ برنده هایکو در کاهش هزینه‌ها

بر اساس اطلاعات مندرج در صفحه قیمت‌گذاری شرکت آنتروپیک، هزینه هایکو ۵.۵ برای درخواست‌های تا سقف ۱۰۰ هزار توکن ورودی، معادل ۰.۱۰ دلار به ازای هر یک میلیون توکن ورودی و ۰.۵۰ دلار به ازای هر یک میلیون توکن خروجی است. آنتروپیک این نرخ‌ها را تقریباً یک‌دهم قیمت توکن‌های هایکو ۴.۵ اعلام کرده است.

علاوه بر این، طبق اطلاعات موجود در صفحه پلتفرم OpenRouter، این مدل از پنجره زمینه‌ای یک میلیون توکنی بهره می‌برد. نکته جذاب دیگر اینکه هایکو ۵.۵ نخستین نسخه از خانواده هایکو است که امکان تنظیم میزان تفکر و استدلال (Adjustable Reasoning Effort) را به توسعه‌دهندگان می‌دهد؛ قابلیتی که به برنامه‌ها اجازه می‌دهد بسته به حساسیت هر درخواست، میزان تفکر مدل را کنترل کنند.

آنتروپیک با این مدل مشخصاً وظایفی مثل ساب‌ایجنت‌ها، خلاصه‌سازی، دسته‌بندی داده‌ها، مسیریابی درخواست‌ها و اتوماسیون مرورگر را هدف گرفته است؛ بخش‌هایی پرکاربرد که بیش‌ترین حجم پردازش را در پایپ‌لاین‌های ایجنتی تشکیل می‌دهند. در نمونه‌ای که از سوی مشتریان منتشر شده، نتایج داخلی شرکت هاب‌اسپات (HubSpot) نشان می‌دهد که این مدل در سه دور اجرای آزمایشی روی تسک‌های CRM به دقت میانگین ۹۲.۸ درصدی رسیده است. البته این ارزیابی خصوصی به یک حوزه کاری خاص تعلق دارد و نمی‌توان آن را مستقیماً با بنچمارک Parallel مقایسه کرد.

نکاتی که پیش از اعتماد کامل به نتایج بنچمارک باید بدانید

  • تأثیر مستقیم پایپ‌لاین بازیابی بر رتبه‌بندی: تمامی آزمون‌های مبتنی بر جستجو با حالت Search Fast شرکت Parallel اجرا شده‌اند؛ بنابراین در صورت استفاده از گوگل، بینگ، سایر APIهای جستجو یا موتورهای بازیابی داخلی، ممکن است رتبه‌ها تغییر کند.
  • نمره‌دهی صفر و یکی در برخی آزمون‌ها: بنچمارک‌های Humanity's Last Exam و WISER پاسخ‌ها را به صورت کاملاً درست یا غلط دسته‌بندی می‌کنند و برای پاسخ‌هایی که تا یک قدمی جواب درست رفته‌اند، هیچ نمره ناقصی قائل نمی‌شوند.
  • محاسبه نشدن هزینه‌های تلاش مجدد (Retry): تخمین‌های ارائه‌شده هزینه تلاش‌های مجدد در تسک‌های ناموفق را نادیده گرفته‌اند؛ این در حالی است که سیستم‌های واقعی در محیط پروداکشن معمولاً جستجوها یا فراخوانی‌های ناموفق را مجدداً تکرار می‌کنند.
  • تأخیر زمانی همچنان قابل‌توجه است: میانگین زمان پاسخگویی هایکو به هر تسک ۱۶۲ ثانیه بود. در مقایسه، مدل GPT-6 Astra با ۱۶.۵ برابر هزینه بیش‌تر به زمان ۸۳.۷ ثانیه رسید و مدل غول‌پیکر اوپوس هم رکورد ۵۱۲ ثانیه را ثبت کرد.
  • محدود بودن جامعه آماری آزمون: یک آزمون ۱۰۰ سوالی می‌تواند به شدت تحت تأثیر نحوه انتخاب پرامپت‌ها، تنوع موضوعات و معیارهای نمره‌دهی قرار گیرد؛ بنابراین تیم‌ها پیش از تصمیم‌گیری نهایی باید عملکرد مدل را با ترافیک واقعی خود بسنجند.

استراتژی هوشمندانه: مسیریابی بر اساس دشواری تسک

سیستم‌های جستجوی مبتنی بر ایجنت می‌توانند از هایکو ۵.۵ به عنوان لایه پیش‌فرض بازیابی اطلاعات استفاده کنند و تنها درخواست‌های بسیار سنگین را به مدل‌های بزرگ‌تر بفرستند. یک استراتژی مسیریابی کاربردی و هوشمندانه می‌تواند شامل این گام‌ها باشد:

  1. سپردن جستجوها و تسک‌های روتین به هایکو: دسته‌بندی، استخراج داده‌ها، خلاصه‌سازی و تحقیقات با چارچوب مشخص کاملاً با پروفایل هزینه‌ای هایکو سازگار هستند.
  2. ارجاع موارد پیچیده به مدل‌های بزرگ‌تر: سوالات چندپهلو و مبهم، منابع متناقض، بررسی‌های ناموفق در ارجاعات و استنتاج‌های ترکیبی چندمرحله‌ای می‌توانند به مدلی با امتیاز و هوش بالا‌تر سپرده شوند.
  3. ارزیابی دقیق کل پایپ‌لاین: نرخ موفقیت تسک‌ها، کیفیت استنادها، میزان مصرف توکن، درصد تلاش‌های مجدد و بیشینه زمان تأخیر (Tail Latency) را با همان ارائه‌دهنده جستجوی محیط پروداکشن خود زیر نظر بگیرید.

با نرخ میانگین این جدول، اجرای ۱۰ میلیون تسک تحقیقاتی با هایکو حدود ۲۴۳ هزار دلار هزینه مدل در بر خواهد داشت. همین حجم کار با مدل MiMo v2.6 Pro تقریباً ۷۶۵ هزار دلار و با غول اوپوس ۵.۵ حدود ۹.۴۹ میلیون دلار تمام می‌شود! البته این برآوردها هزینه‌های API جستجو، تلاش‌های مجدد، زیرساخت هماهنگی ایجنت‌ها و تفاوت طول پرامپت‌ها در محیط پروداکشن را شامل نمی‌شود.

برای تیم‌هایی که در حال حاضر از هایکو ۴.۵ برای کار‌هایی مثل دسته‌بندی یا استخراج متن استفاده می‌کنند، هایکو ۵.۵ گزینه‌ای ایده‌آل برای ارزیابی است؛ چرا که قیمت پایین‌تر توکن‌ها را با عملکرد جستجوی به مراتب قوی‌تر در آزمون Parallel ترکیب کرده است. با این حال، اجرای یک آزمایش کنترل‌شده در محیط واقعی مشخص خواهد کرد که آیا دقت، سرعت پاسخ‌دهی و هزینه‌های عملیاتی آن زیر بار ترافیک اختصاصی برنامه شما نیز پایدار می‌ماند یا خیر.

بازخورد و اشتراک‌گذاری این مطلب

اگر این گزارش برایتان مفید بود، با پسندیدن و اشتراک‌گذاری آن با دیگران، از محتوای تخصصی هوش مصنوعی حمایت کنید.

اشتراک‌گذاری در شبکه‌های اجتماعی:

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

نقشه اپل برای پادکست‌های هوش مصنوعی: جذب بی‌سروصدای تیم و فناوری استارتاپ Huxe
آخرین اخبار

نقشه اپل برای پادکست‌های هوش مصنوعی: جذب بی‌سروصدای تیم و فناوری استارتاپ Huxe

اپل با امضای قراردادی هوشمندانه، تیم و فناوری استارتاپ Huxe را جذب کرده تا احتمالاً قابلیت تولید پادکست‌های صوتی با هوش مصنوعی را به سرویس‌های خود بیاورد. بنیان‌گذاران این استارتاپ همان چهره‌هایی هستند که پیش از این پادکست‌های گفت‌وگومحور و پر سر و صدای NotebookLM را ساخته بودند.

۲ دقیقه مطالعه
۰
۱۸ مهر
رکوردشکنی vLLM روی معماری جدید انویدیا: اجرای مدل MiniMax تا ۸ برابر سریع‌تر با تراشه‌های Vera Rubin!
آخرین اخبار

رکوردشکنی vLLM روی معماری جدید انویدیا: اجرای مدل MiniMax تا ۸ برابر سریع‌تر با تراشه‌های Vera Rubin!

فریم‌ورک محبوب vLLM با انتشار بیلدهای آزمایشی، پشتیبانی از نسل آینده تراشه‌های انویدیا با معماری Vera Rubin را آغاز کرده و در بنچمارک‌های اولیه، به سرعت اعجاب‌انگیز نزدیک به ۸ برابری در اجرای مدل‌های زبانی بزرگ دست یافته است. این جهش عظیم به لطف پهنای باند خیره‌کننده حافظه‌های HBM4 و بهینه‌سازی‌های عمیق هسته‌های پردازشی رقم خورده که مسیر جدیدی را برای استنتاج ارزان‌تر و سریع‌تر هوش مصنوعی هموار می‌کند.

۵ دقیقه مطالعه
۰
۱۸ مهر
اشتهای سیری‌ناپذیر هوش مصنوعی برای زمین و انرژی: دیتاسنترهایی که مزارع چند ایالت آمریکا را می‌بلعند!
آخرین اخبار

اشتهای سیری‌ناپذیر هوش مصنوعی برای زمین و انرژی: دیتاسنترهایی که مزارع چند ایالت آمریکا را می‌بلعند!

تب تند توسعه هوش مصنوعی حالا پایش به مزارع گندم و چراگاه‌های آرام آمریکا باز شده و دیتاسنترهای عظیم در حال تصاحب ده‌ها هزار هکتار از اراضی کشاورزی هستند. اما ماجرا فقط از دست رفتن زمین‌ها نیست؛ خلأهای قانونی و فرآیندهای اداری ناقص باعث شده ابعاد واقعی مصرف نجومی برق و زیرساخت‌های جانبی این غول‌های دیجیتال از دید مردم و شوراهای محلی پنهان بماند.

۵ دقیقه مطالعه
۰
۱۸ مهر