پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

سقوط آزاد هزینه استدلال هوش مصنوعی با دیپ‌سیک؛ حل معماهای منطقی فقط با ۱ سنت!

انتشار:۸ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

تازه‌ترین نتایج بنچمارک ARC-AGI از سقوط خیره‌کننده ۹۹ درصدی هزینه استدلال هوش مصنوعی حکایت دارد؛ جایی که مدل DeepSeek V4 Flash حالا می‌تواند فقط با ۱ سنت به دقت ۷۵ درصدی برسد. این در حالی است که تا همین چند ماه پیش، رسیدن به چنین دقتی ده‌ها دلار هزینه داشت. این جهش اقتصادی بی‌سابقه، مسیر را برای اجرای گسترده و ارزان ایجنت‌های هوشمند در دنیای واقعی هموار می‌کند.

سقوط آزاد هزینه استدلال هوش مصنوعی با دیپ‌سیک؛ حل معماهای منطقی فقط با ۱ سنت!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • سقوط ۹۹ درصدی هزینه‌ها: حل تست‌های استدلال انتزاعی در بنچمارک معتبر ARC-AGI ظرف ۱۹ ماه از ۲۶ دلار به ازای هر تسک، به فقط ۱ سنت برای مدل DeepSeek V4 Flash رسیده است.
  • چهار عامل پشت این جهش قیمتی: معماری با فعال‌سازی پراکنده (Sparse)، استدلال تطبیقی برای مصرف کم‌تر توکن، بهینه‌سازی فریم‌ورک‌های ارزیابی و تخفیف‌های دائمی دیپ‌سیک این افت تاریخی را رقم زده‌اند.
  • چالش نمرات برتر: اگرچه ثبت بالا‌ترین رکوردها هنوز دلارهای زیادی خرج برمی‌دارد، اما برای کاربردهای روزمره، استدلال مکرر و اعتبارسنجی ایجنت‌ها به شدت اقتصادی و ارزان شده است.

سقوط هزینه استدلال در بنچمارک ARC-AGI؛ از چند ده دلار به چند سنت!

تازه‌ترین رتبه‌بندی بنچمارک ARC Prize نشان می‌دهد که هزینه حل معماهای استدلال انتزاعی توسط هوش مصنوعی، ظرف چند ماه بیش از ۹۹ درصد کاهش یافته است. کاهش قیمت فراخوانی مدل‌ها، معماری‌های مبتنی بر فعال‌سازی پراکنده (Sparse)، استدلال تطبیقی و نرم‌افزارهای ارزیابی کارآمدتر، همگی دست به دست هم داده‌اند تا این اتفاق بیفتد. برای توسعه‌دهندگان، این دستاورد یعنی حالا می‌توان از استدلال مکرر و اعتبارسنجی مداوم در جریان‌های کاری پیچیده‌ترِ ایجنت‌ها استفاده کرد؛ البته به شرطی که این صرفه اقتصادی در آزمون‌های واقعی و محیط‌های عملیاتی هم پابرجا بماند.

بنچمارک ARC چطور کار می‌کند؟ کشف قوانین از روی چند مثال محدود

فرانسوا شوله (François Chollet) بنچمارک ARC-AGI را برای این طراحی کرد تا بسنجد آیا یک سیستم هوش مصنوعی می‌تواند قوانین ناشناخته را صرفاً با دیدن چند مثال محدود استنتاج کند یا نه. در هر معما، شبکه‌هایی از خانه‌های ورودی و خروجی به مدل نشان داده می‌شوند و از آن خواسته می‌شود قاعده تبدیل را کشف کرده و روی یک شبکه جدید اعمال کند. این الگوهای بصری جدید و منحصربه‌فرد، ارزش حفظ کردن داده‌های آموزشی را به صفر می‌رسانند و هر معما را به یک آزمون فشرده از قدرت انتزاع واقعی تبدیل می‌کنند.

نسخه دوم این بنچمارک یعنی ARC-AGI-2، درجه سختی را با معماهایی که نیازمند ترکیب چندین مفهوم و تبدیلات بسیار دقیق‌تر هستند بالا برده است. گزارش تحلیل نتایج ARC Prize نشان می‌دهد که مدل‌های زبانی خالص در تنظیمات استاندارد ارزیابی، نمره صفر درصد گرفتند؛ در حالی که شرکت‌کنندگان انسانی توانستند تمام معماها را با موفقیت حل کنند.

جدول رده‌بندی این مسابقه، میزان دقت را در کنار برآورد هزینه حل هر معما منتشر می‌کند. این رقم نشان‌دهنده هزینه مستقیم استفاده از API در چارچوب ارزیابی (Harness) ارائه‌شده است؛ یعنی پرامپت‌ها، تلاش‌های مجدد و توکن‌های تولیدشده در آن محاسبه شده‌اند، اما هزینه‌های سخت‌افزاری، تأخیر زمانی (Latency) و هزینه‌های مهندسی در این ارقام لحاظ نشده‌اند.

رسیدن به خط مرجع ARC-AGI-1 فقط با ۱ سنت!

بنچمارک
مقایسه
هزینه قبلی
هزینه جدید
بازه زمانی
میزان کاهش
ARC-AGI-1
خط مرجع ۷۵ درصد
۲۶.۰۰ دلار به ازای هر تسک
۰.۰۱ دلار به ازای هر تسک
۱۹ ماه
۹۹.۹۶٪
ARC-AGI-2
مقایسه هزینه‌های ثبت‌شده
۱۳.۶۲ دلار به ازای هر تسک
۰.۰۸ دلار به ازای هر تسک
۶ ماه
۹۹.۴۱٪

مدل DeepSeek V4 Flash 0731 موفق شده به خط مرجع ۷۵ درصدی نمودار ARC-AGI-1 با هزینه‌ای در حدود یک سنت برای هر تسک برسد؛ این در حالی است که ۱۹ ماه قبل، مدل o3-preview برای رسیدن به این مرز تقریباً ۲۶ دلار برای هر تسک هزینه روی دست تیم‌ها می‌گذاشت. ردیف مربوط به ARC-AGI-2 از یک مقایسه مجزا در نمودار استفاده می‌کند، چون بالا‌ترین امتیاز دیپ‌سیک در این بنچمارک دشوارتر هنوز به ۷۵ درصد نرسیده است.

بنچمارک
دقت
هزینه هر تسک
مجموعه نیمه‌خصوصی ARC-AGI-1
۸۹.۰٪
۰.۰۲ دلار
مجموعه نیمه‌خصوصی ARC-AGI-2
۶۱.۴٪
۰.۰۴ دلار

نتیجه یک سنتی دیپ‌سیک در بنچمارک ARC-AGI-1 با تنظیمات تلاشی (Effort Setting) سبک‌تر و ارزان‌تر به دست آمده که صرفاً برای عبور از مرز ۷۵ درصد کافی بوده است. با اعمال حداکثر تلاش و استدلال، این مدل به ازای هر تسک حدود دو سنت خرج برمی‌دارد و به دقت فوق‌العاده ۸۹.۰ درصدی می‌رسد. بنابراین در هر مقایسه هزینه‌ای، باید سطح تلاش تنظیم‌شده برای مدل را هم حتماً مد نظر قرار داد.

نمرات برتر جدول هنوز گران تمام می‌شوند!

بنچمارک
مدل
دقت
هزینه هر تسک
ARC-AGI-1
Gemini 3 Deep Think
بیش از ۹۶٪
۷.۱۷ دلار
ARC-AGI-1
Opus 4.6
۹۳.۰٪
۱.۸۸ دلار
ARC-AGI-1
GPT-5.2 Pro
۹۰.۵٪
۱۱.۶۴ دلار
ARC-AGI-2
Gemini 3 Deep Think
۸۴.۶٪
۱۳.۶۲ دلار

مدل Gemini 3 Deep Think با ثبت دقت ۸۴.۶ درصدی و هزینه ۱۳.۶۲ دلاری برای هر تسک، صدرنشین نتایج ARC-AGI-2 است. در بنچمارک ARC-AGI-1 نیز هزینه ۱۱.۶۴ دلاری مدل GPT-5.2 Pro حدود ۳۸۷ برابر کم‌تر از هزینه اعلام‌شده ۴۵۰۰ دلاری مدل o3 در یک سال گذشته است؛ هرچند این اجراها از مدل‌ها، امتیازات و تنظیمات ارزیابی متفاوتی استفاده کرده‌اند.

فاصله چشمگیر میان هزینه‌های ناچیز دیپ‌سیک و بالا‌ترین امتیازات جدول، یک سبک و سنگین کردن تجاری و فنی (Trade-off) مهم را به تصویر می‌کشد: دستیابی به درصدهای اندک دقت در بالا‌ترین سطح، ممکن است نیازمند پردازش و استدلال به مراتب سنگین‌تری باشد، در حالی که در بسیاری از کاربردهای روزمره، یک سطح استدلال ارزان‌تر و سبک‌تر هم کار را کاملاً راه می‌اندازد.

چهار عاملی که هزینه‌ها را به قعر کشیدند

  1. فعال‌سازی پراکنده بار محاسباتی را سبک می‌کند: بر اساس گزارش‌ها، معماری مدل ترکیبی از متخصصان (MoE) ۵۵۲ میلیارد پارامتری دیپ‌سیک، هنگام پردازش پرامپت تنها حدود ۸ میلیارد پارامتر و هنگام تولید پاسخ حدود ۱۶ میلیارد پارامتر را فعال می‌کند. در پردازش هر توکن، بیش‌تر پارامترها غیرفعال می‌مانند و این یعنی بار پردازشی سرور‌ها به شکل چشمگیری پایین می‌آید.
  2. استدلال تطبیقی مانع هدررفت توکن‌ها می‌شود: در مقایسه ارائه‌شده از دیپ‌سیک، حالت حداکثر تلاش در مجموع توکن‌های استدلال کمتری نسبت به حالت تلاش بالا مصرف کرد و در عین حال معماهای بیشتری را حل نمود. این یافته نشان می‌دهد که تنظیم رفتار توقف هوشمندانه مدل می‌تواند بدون افزایش سرسام‌آور تعداد توکن‌ها، دقت را به طور محسوسی بالا ببرد.
  3. طراحی فریم‌ورک ارزیابی (Harness) بازی را عوض می‌کند: فریم‌ورک ارزیابی یا Harness وظیفه قالب‌بندی مثال‌ها، فراخوانی مدل، پردازش خروجی و مدیریت تلاش‌های مجدد را بر عهده دارد. آزمایشی در شرکت OpenAI نشان داد که تنها با جایگزین کردن هارنس عمومی با یک نسخه بهینه‌سازی‌شده داخلی، امتیاز ARC-AGI بدون دست زدن به خودِ مدل از حدود ۱۳ درصد به ۴۰ درصد جهش کرد!
  4. تخفیف‌های دائمی ارائه‌دهندگان هزینه را آب می‌کند: دیپ‌سیک تخفیف ۷۵ درصدی جشنواره‌ای خود را دائمی کرد و قیمت مدل V4 Pro را از بازه ۰.۰۱۴۵ تا ۳.۴۸ دلار به ازای هر میلیون توکن، به ۰.۰۰۳۶۲۵ تا ۰.۸۷ دلار رساند. از آنجا که هزینه‌های جدول رده‌بندی بر اساس قیمت رسمی سرویس‌دهندگان محاسبه می‌شود، این تخفیف‌های تجاری حتی در صورت ثابت ماندن مصرف توکن، هزینه نهایی هر معما را به شدت کاهش می‌دهند.

محاسبه بودجه عملیاتی؛ حساب و کتاب دنیای واقعی فرق می‌کند!

از آنجا که هر تسک در بنچمارک ARC پرامپت، فرمت خروجی، سیاست تلاش مجدد و فریم‌ورک مخصوص به خود را دارد، نمی‌توان هزینه‌های آن را مستقیماً برای برآورد بودجه یک ایجنت برنامه‌نویسی کپی کرد. یک مقایسه ساده تفاوت ابعاد را نشان می‌دهد: اجرای ۵۰ تسک مشابه ARC با هزینه ۲ سنت به ازای هر تسک کلاً ۱ دلار تمام می‌شود، در حالی که ۵۰ تسک با هزینه ۱۱.۶۴ دلاری بالغ بر ۵۸۲ دلار آب می‌خورد! فراخوانی‌های واقعی ایجنت‌ها معمولاً شامل کانتکست‌های طولانی‌تر، ابزار‌های مختلف، کش توکن‌ها و چندین مرحله اعتبارسنجی متوالی است.

تیم‌هایی که قصد دارند این مدل‌ها را به کار بگیرند، باید کل هزینه رسیدن به یک نتیجه موفق در برنامه کاربردی خود را از طریق تست‌های کنترل‌شده بسنجند:

  • بازسازی محیط کاری واقعی: به جای تکیه بر نمرات خام بنچمارک، حتماً از پرامپت‌ها، ابزارها، پارسرها و قواعد تلاش مجدد مخصوص محیط پروداکشن خودتان استفاده کنید.
  • رهگیری نتایج پذیرفته‌شده: کل هزینه صرف‌شده را بر تعداد خروجی‌هایی که آزمون‌های کیفی برنامه شما را پاس کرده‌اند تقسیم کنید؛ یعنی تلاش‌های ناموفق و هزینه‌های اعتبارسنجی را هم در محاسبات بیاورید.
  • تنظیم پویای سطح استدلال: درخواست‌های ساده را به حالت‌های سبک‌تر و ارزان‌تر بفرستید و فقط مواردی را که مدل در آنها دچار ابهام و تردید است به سطوح استدلال عمیق هدایت کنید.
  • سنجش عملکرد عملیاتی: تأخیر میانه و تأخیر در بد‌ترین حالات (Tail Latency)، خطاهای محدودیت نرخ (Rate-limit)، میزان مصرف کانتکست و واریانس خروجی‌ها را با دقت ثبت کنید.
  • بررسی محدودیت‌های استقرار: در دسترس بودن API، پشتیبانی منطقه‌ای، قوانین حریم خصوصی و محدودیت‌های سرویس را که در لیدربورد بنچمارک ARC دیده نمی‌شوند، حتماً بررسی کنید.

محدودیت‌های این ارزیابی را نادیده نگیرید

ارزیابی‌های نیمه‌خصوصی با مجموعه کاملاً محرمانه‌ای که برای تعیین برنده نهایی جایزه ARC Prize استفاده می‌شود تفاوت دارند و نحوه پیکربندی فریم‌ورک ارزیابی (Harness) می‌تواند نمره و هزینه را زیر و رو کند. علاوه بر این، تسک‌های ARC صرفاً روی تبدیلات شبکه‌ای انتزاعی متمرکز هستند و مهارت‌هایی مثل کدنویسی، استفاده از ابزارها، بازیابی کانتکست طولانی و دانش تخصصی حوزه‌ها را محک نمی‌زنند.

با این همه، استدلال مکرر حالا به قدری ارزان و در دسترس شده که راه را برای جست‌وجوهای گسترده‌تر، اعتبارسنجی گام‌به‌گام و تکثیر ایجنت‌های هوشمند باز می‌کند. حالا نوبت ارزیابی‌های اختصاصی در هر کسب‌وکار است تا مطمئن شوند این هزینه‌های اندک، در مواجهه با پرامپت‌های واقعی، محدودیت‌های فنی و نرخ موفقیت تجاری هم دوام می‌آورند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!
آخرین اخبار

ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!

شرکت متا با یک ترفند حسابداری زیرکانه و ثبت رک‌های سرور هوش مصنوعی به عنوان «تجهیزات آزمایشی»، توانسته معافیت مالیاتی پژوهشی خود را به رقم سرسام‌آور ۳.۹ میلیارد دلار برساند. کارشناسان مالیاتی این اقدام را از نظر قانونی بسیار پرریسک و مشکوک می‌دانند، اما در صورت تأیید، راه برای معافیت‌های مالیاتی نجومی سایر غول‌های هوش مصنوعی نیز هموار خواهد شد.

۴ دقیقه مطالعه
۰
۸ مهر
رونمایی AMD از ایجنت هوش مصنوعی Ross؛ انقلابی در طراحی سخت‌افزار و سیستم‌های امبدد
آخرین اخبار

رونمایی AMD از ایجنت هوش مصنوعی Ross؛ انقلابی در طراحی سخت‌افزار و سیستم‌های امبدد

شرکت AMD با رونمایی از ایجنت هوش مصنوعی Ross، به سراغ دگرگون‌کردن چرخه توسعه سیستم‌های امبدد و سخت‌افزارهای پیشرفته رفته است. این دستیار هوشمند با اتصال مستقیم به زنجیره ابزار‌های مهندسی، فرآیندهای چندهفته‌ای طراحی و بستن زمان‌بندی تراشه‌ها را به چند ساعت کاهش می‌دهد و همکاری بین مهندسان سخت‌افزار و نرم‌افزار را از همیشه ساده‌تر می‌کند.

۶ دقیقه مطالعه
۰
۸ مهر
آموزش فیزیک واقعی به هوش مصنوعی ویدیوساز؛ فریم‌ورک Physis-Lang انویدیا مدل Veo 3.1 گوگل را شکست داد
آخرین اخبار

آموزش فیزیک واقعی به هوش مصنوعی ویدیوساز؛ فریم‌ورک Physis-Lang انویدیا مدل Veo 3.1 گوگل را شکست داد

انویدیا با معرفی فریم‌ورک متن‌باز Physis-Lang، یکی از بزرگ‌ترین نقطه‌ضعف‌های هوش مصنوعی در تولید ویدیو را هدف گرفته و قوانین دنیای واقعی مثل جاذبه و گرما را به مدل‌ها آموزش می‌دهد. این سیستم با غنی‌سازی پرامپت‌ها و داده‌های آموزشی بر اساس علت و معلول، توانسته حتی از مدل قدرتمند Veo 3.1 گوگل هم در درک فیزیک پیشی بگیرد.

۵ دقیقه مطالعه
۰
۸ مهر