سقوط آزاد هزینه استدلال هوش مصنوعی با دیپسیک؛ حل معماهای منطقی فقط با ۱ سنت!
تازهترین نتایج بنچمارک ARC-AGI از سقوط خیرهکننده ۹۹ درصدی هزینه استدلال هوش مصنوعی حکایت دارد؛ جایی که مدل DeepSeek V4 Flash حالا میتواند فقط با ۱ سنت به دقت ۷۵ درصدی برسد. این در حالی است که تا همین چند ماه پیش، رسیدن به چنین دقتی دهها دلار هزینه داشت. این جهش اقتصادی بیسابقه، مسیر را برای اجرای گسترده و ارزان ایجنتهای هوشمند در دنیای واقعی هموار میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- سقوط ۹۹ درصدی هزینهها: حل تستهای استدلال انتزاعی در بنچمارک معتبر ARC-AGI ظرف ۱۹ ماه از ۲۶ دلار به ازای هر تسک، به فقط ۱ سنت برای مدل DeepSeek V4 Flash رسیده است.
- چهار عامل پشت این جهش قیمتی: معماری با فعالسازی پراکنده (Sparse)، استدلال تطبیقی برای مصرف کمتر توکن، بهینهسازی فریمورکهای ارزیابی و تخفیفهای دائمی دیپسیک این افت تاریخی را رقم زدهاند.
- چالش نمرات برتر: اگرچه ثبت بالاترین رکوردها هنوز دلارهای زیادی خرج برمیدارد، اما برای کاربردهای روزمره، استدلال مکرر و اعتبارسنجی ایجنتها به شدت اقتصادی و ارزان شده است.
سقوط هزینه استدلال در بنچمارک ARC-AGI؛ از چند ده دلار به چند سنت!
تازهترین رتبهبندی بنچمارک ARC Prize نشان میدهد که هزینه حل معماهای استدلال انتزاعی توسط هوش مصنوعی، ظرف چند ماه بیش از ۹۹ درصد کاهش یافته است. کاهش قیمت فراخوانی مدلها، معماریهای مبتنی بر فعالسازی پراکنده (Sparse)، استدلال تطبیقی و نرمافزارهای ارزیابی کارآمدتر، همگی دست به دست هم دادهاند تا این اتفاق بیفتد. برای توسعهدهندگان، این دستاورد یعنی حالا میتوان از استدلال مکرر و اعتبارسنجی مداوم در جریانهای کاری پیچیدهترِ ایجنتها استفاده کرد؛ البته به شرطی که این صرفه اقتصادی در آزمونهای واقعی و محیطهای عملیاتی هم پابرجا بماند.
بنچمارک ARC چطور کار میکند؟ کشف قوانین از روی چند مثال محدود
فرانسوا شوله (François Chollet) بنچمارک ARC-AGI را برای این طراحی کرد تا بسنجد آیا یک سیستم هوش مصنوعی میتواند قوانین ناشناخته را صرفاً با دیدن چند مثال محدود استنتاج کند یا نه. در هر معما، شبکههایی از خانههای ورودی و خروجی به مدل نشان داده میشوند و از آن خواسته میشود قاعده تبدیل را کشف کرده و روی یک شبکه جدید اعمال کند. این الگوهای بصری جدید و منحصربهفرد، ارزش حفظ کردن دادههای آموزشی را به صفر میرسانند و هر معما را به یک آزمون فشرده از قدرت انتزاع واقعی تبدیل میکنند.
نسخه دوم این بنچمارک یعنی ARC-AGI-2، درجه سختی را با معماهایی که نیازمند ترکیب چندین مفهوم و تبدیلات بسیار دقیقتر هستند بالا برده است. گزارش تحلیل نتایج ARC Prize نشان میدهد که مدلهای زبانی خالص در تنظیمات استاندارد ارزیابی، نمره صفر درصد گرفتند؛ در حالی که شرکتکنندگان انسانی توانستند تمام معماها را با موفقیت حل کنند.
جدول ردهبندی این مسابقه، میزان دقت را در کنار برآورد هزینه حل هر معما منتشر میکند. این رقم نشاندهنده هزینه مستقیم استفاده از API در چارچوب ارزیابی (Harness) ارائهشده است؛ یعنی پرامپتها، تلاشهای مجدد و توکنهای تولیدشده در آن محاسبه شدهاند، اما هزینههای سختافزاری، تأخیر زمانی (Latency) و هزینههای مهندسی در این ارقام لحاظ نشدهاند.
رسیدن به خط مرجع ARC-AGI-1 فقط با ۱ سنت!
بنچمارک | مقایسه | هزینه قبلی | هزینه جدید | بازه زمانی | میزان کاهش |
|---|---|---|---|---|---|
ARC-AGI-1 | خط مرجع ۷۵ درصد | ۲۶.۰۰ دلار به ازای هر تسک | ۰.۰۱ دلار به ازای هر تسک | ۱۹ ماه | ۹۹.۹۶٪ |
ARC-AGI-2 | مقایسه هزینههای ثبتشده | ۱۳.۶۲ دلار به ازای هر تسک | ۰.۰۸ دلار به ازای هر تسک | ۶ ماه | ۹۹.۴۱٪ |
مدل DeepSeek V4 Flash 0731 موفق شده به خط مرجع ۷۵ درصدی نمودار ARC-AGI-1 با هزینهای در حدود یک سنت برای هر تسک برسد؛ این در حالی است که ۱۹ ماه قبل، مدل o3-preview برای رسیدن به این مرز تقریباً ۲۶ دلار برای هر تسک هزینه روی دست تیمها میگذاشت. ردیف مربوط به ARC-AGI-2 از یک مقایسه مجزا در نمودار استفاده میکند، چون بالاترین امتیاز دیپسیک در این بنچمارک دشوارتر هنوز به ۷۵ درصد نرسیده است.
بنچمارک | دقت | هزینه هر تسک |
|---|---|---|
مجموعه نیمهخصوصی ARC-AGI-1 | ۸۹.۰٪ | ۰.۰۲ دلار |
مجموعه نیمهخصوصی ARC-AGI-2 | ۶۱.۴٪ | ۰.۰۴ دلار |
نتیجه یک سنتی دیپسیک در بنچمارک ARC-AGI-1 با تنظیمات تلاشی (Effort Setting) سبکتر و ارزانتر به دست آمده که صرفاً برای عبور از مرز ۷۵ درصد کافی بوده است. با اعمال حداکثر تلاش و استدلال، این مدل به ازای هر تسک حدود دو سنت خرج برمیدارد و به دقت فوقالعاده ۸۹.۰ درصدی میرسد. بنابراین در هر مقایسه هزینهای، باید سطح تلاش تنظیمشده برای مدل را هم حتماً مد نظر قرار داد.
نمرات برتر جدول هنوز گران تمام میشوند!
بنچمارک | مدل | دقت | هزینه هر تسک |
|---|---|---|---|
ARC-AGI-1 | Gemini 3 Deep Think | بیش از ۹۶٪ | ۷.۱۷ دلار |
ARC-AGI-1 | Opus 4.6 | ۹۳.۰٪ | ۱.۸۸ دلار |
ARC-AGI-1 | GPT-5.2 Pro | ۹۰.۵٪ | ۱۱.۶۴ دلار |
ARC-AGI-2 | Gemini 3 Deep Think | ۸۴.۶٪ | ۱۳.۶۲ دلار |
مدل Gemini 3 Deep Think با ثبت دقت ۸۴.۶ درصدی و هزینه ۱۳.۶۲ دلاری برای هر تسک، صدرنشین نتایج ARC-AGI-2 است. در بنچمارک ARC-AGI-1 نیز هزینه ۱۱.۶۴ دلاری مدل GPT-5.2 Pro حدود ۳۸۷ برابر کمتر از هزینه اعلامشده ۴۵۰۰ دلاری مدل o3 در یک سال گذشته است؛ هرچند این اجراها از مدلها، امتیازات و تنظیمات ارزیابی متفاوتی استفاده کردهاند.
فاصله چشمگیر میان هزینههای ناچیز دیپسیک و بالاترین امتیازات جدول، یک سبک و سنگین کردن تجاری و فنی (Trade-off) مهم را به تصویر میکشد: دستیابی به درصدهای اندک دقت در بالاترین سطح، ممکن است نیازمند پردازش و استدلال به مراتب سنگینتری باشد، در حالی که در بسیاری از کاربردهای روزمره، یک سطح استدلال ارزانتر و سبکتر هم کار را کاملاً راه میاندازد.
چهار عاملی که هزینهها را به قعر کشیدند
- فعالسازی پراکنده بار محاسباتی را سبک میکند: بر اساس گزارشها، معماری مدل ترکیبی از متخصصان (MoE) ۵۵۲ میلیارد پارامتری دیپسیک، هنگام پردازش پرامپت تنها حدود ۸ میلیارد پارامتر و هنگام تولید پاسخ حدود ۱۶ میلیارد پارامتر را فعال میکند. در پردازش هر توکن، بیشتر پارامترها غیرفعال میمانند و این یعنی بار پردازشی سرورها به شکل چشمگیری پایین میآید.
- استدلال تطبیقی مانع هدررفت توکنها میشود: در مقایسه ارائهشده از دیپسیک، حالت حداکثر تلاش در مجموع توکنهای استدلال کمتری نسبت به حالت تلاش بالا مصرف کرد و در عین حال معماهای بیشتری را حل نمود. این یافته نشان میدهد که تنظیم رفتار توقف هوشمندانه مدل میتواند بدون افزایش سرسامآور تعداد توکنها، دقت را به طور محسوسی بالا ببرد.
- طراحی فریمورک ارزیابی (Harness) بازی را عوض میکند: فریمورک ارزیابی یا Harness وظیفه قالببندی مثالها، فراخوانی مدل، پردازش خروجی و مدیریت تلاشهای مجدد را بر عهده دارد. آزمایشی در شرکت OpenAI نشان داد که تنها با جایگزین کردن هارنس عمومی با یک نسخه بهینهسازیشده داخلی، امتیاز ARC-AGI بدون دست زدن به خودِ مدل از حدود ۱۳ درصد به ۴۰ درصد جهش کرد!
- تخفیفهای دائمی ارائهدهندگان هزینه را آب میکند: دیپسیک تخفیف ۷۵ درصدی جشنوارهای خود را دائمی کرد و قیمت مدل V4 Pro را از بازه ۰.۰۱۴۵ تا ۳.۴۸ دلار به ازای هر میلیون توکن، به ۰.۰۰۳۶۲۵ تا ۰.۸۷ دلار رساند. از آنجا که هزینههای جدول ردهبندی بر اساس قیمت رسمی سرویسدهندگان محاسبه میشود، این تخفیفهای تجاری حتی در صورت ثابت ماندن مصرف توکن، هزینه نهایی هر معما را به شدت کاهش میدهند.
محاسبه بودجه عملیاتی؛ حساب و کتاب دنیای واقعی فرق میکند!
از آنجا که هر تسک در بنچمارک ARC پرامپت، فرمت خروجی، سیاست تلاش مجدد و فریمورک مخصوص به خود را دارد، نمیتوان هزینههای آن را مستقیماً برای برآورد بودجه یک ایجنت برنامهنویسی کپی کرد. یک مقایسه ساده تفاوت ابعاد را نشان میدهد: اجرای ۵۰ تسک مشابه ARC با هزینه ۲ سنت به ازای هر تسک کلاً ۱ دلار تمام میشود، در حالی که ۵۰ تسک با هزینه ۱۱.۶۴ دلاری بالغ بر ۵۸۲ دلار آب میخورد! فراخوانیهای واقعی ایجنتها معمولاً شامل کانتکستهای طولانیتر، ابزارهای مختلف، کش توکنها و چندین مرحله اعتبارسنجی متوالی است.
تیمهایی که قصد دارند این مدلها را به کار بگیرند، باید کل هزینه رسیدن به یک نتیجه موفق در برنامه کاربردی خود را از طریق تستهای کنترلشده بسنجند:
- بازسازی محیط کاری واقعی: به جای تکیه بر نمرات خام بنچمارک، حتماً از پرامپتها، ابزارها، پارسرها و قواعد تلاش مجدد مخصوص محیط پروداکشن خودتان استفاده کنید.
- رهگیری نتایج پذیرفتهشده: کل هزینه صرفشده را بر تعداد خروجیهایی که آزمونهای کیفی برنامه شما را پاس کردهاند تقسیم کنید؛ یعنی تلاشهای ناموفق و هزینههای اعتبارسنجی را هم در محاسبات بیاورید.
- تنظیم پویای سطح استدلال: درخواستهای ساده را به حالتهای سبکتر و ارزانتر بفرستید و فقط مواردی را که مدل در آنها دچار ابهام و تردید است به سطوح استدلال عمیق هدایت کنید.
- سنجش عملکرد عملیاتی: تأخیر میانه و تأخیر در بدترین حالات (Tail Latency)، خطاهای محدودیت نرخ (Rate-limit)، میزان مصرف کانتکست و واریانس خروجیها را با دقت ثبت کنید.
- بررسی محدودیتهای استقرار: در دسترس بودن API، پشتیبانی منطقهای، قوانین حریم خصوصی و محدودیتهای سرویس را که در لیدربورد بنچمارک ARC دیده نمیشوند، حتماً بررسی کنید.
محدودیتهای این ارزیابی را نادیده نگیرید
ارزیابیهای نیمهخصوصی با مجموعه کاملاً محرمانهای که برای تعیین برنده نهایی جایزه ARC Prize استفاده میشود تفاوت دارند و نحوه پیکربندی فریمورک ارزیابی (Harness) میتواند نمره و هزینه را زیر و رو کند. علاوه بر این، تسکهای ARC صرفاً روی تبدیلات شبکهای انتزاعی متمرکز هستند و مهارتهایی مثل کدنویسی، استفاده از ابزارها، بازیابی کانتکست طولانی و دانش تخصصی حوزهها را محک نمیزنند.
با این همه، استدلال مکرر حالا به قدری ارزان و در دسترس شده که راه را برای جستوجوهای گستردهتر، اعتبارسنجی گامبهگام و تکثیر ایجنتهای هوشمند باز میکند. حالا نوبت ارزیابیهای اختصاصی در هر کسبوکار است تا مطمئن شوند این هزینههای اندک، در مواجهه با پرامپتهای واقعی، محدودیتهای فنی و نرخ موفقیت تجاری هم دوام میآورند.
مطالب مرتبط و پیشنهادی

ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!
شرکت متا با یک ترفند حسابداری زیرکانه و ثبت رکهای سرور هوش مصنوعی به عنوان «تجهیزات آزمایشی»، توانسته معافیت مالیاتی پژوهشی خود را به رقم سرسامآور ۳.۹ میلیارد دلار برساند. کارشناسان مالیاتی این اقدام را از نظر قانونی بسیار پرریسک و مشکوک میدانند، اما در صورت تأیید، راه برای معافیتهای مالیاتی نجومی سایر غولهای هوش مصنوعی نیز هموار خواهد شد.

رونمایی AMD از ایجنت هوش مصنوعی Ross؛ انقلابی در طراحی سختافزار و سیستمهای امبدد
شرکت AMD با رونمایی از ایجنت هوش مصنوعی Ross، به سراغ دگرگونکردن چرخه توسعه سیستمهای امبدد و سختافزارهای پیشرفته رفته است. این دستیار هوشمند با اتصال مستقیم به زنجیره ابزارهای مهندسی، فرآیندهای چندهفتهای طراحی و بستن زمانبندی تراشهها را به چند ساعت کاهش میدهد و همکاری بین مهندسان سختافزار و نرمافزار را از همیشه سادهتر میکند.

آموزش فیزیک واقعی به هوش مصنوعی ویدیوساز؛ فریمورک Physis-Lang انویدیا مدل Veo 3.1 گوگل را شکست داد
انویدیا با معرفی فریمورک متنباز Physis-Lang، یکی از بزرگترین نقطهضعفهای هوش مصنوعی در تولید ویدیو را هدف گرفته و قوانین دنیای واقعی مثل جاذبه و گرما را به مدلها آموزش میدهد. این سیستم با غنیسازی پرامپتها و دادههای آموزشی بر اساس علت و معلول، توانسته حتی از مدل قدرتمند Veo 3.1 گوگل هم در درک فیزیک پیشی بگیرد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.