بررسی پدیده «مالیات هارنس» در ایجنتهای کدنویسی: چگونه هزینه استنتاج مدلها تا ۵ برابر میشود؟
پژوهشهای جدید نشان میدهد که بستر اجرایی یا «هارنس» ایجنتهای کدنویسی میتواند هزینه استفاده از یک مدل هوش مصنوعی را تا ۵ برابر افزایش دهد، بدون آنکه دستاورد چشمگیری در میزان موفقیت وظایف برنامهنویسی به همراه داشته باشد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- انتخاب بستر اجرایی (هارنس) میتواند هزینه اجرای مدلهای هوش مصنوعی را به شدت افزایش دهد، درحالیکه تاثیر آن بر موفقیت وظایف بسیار ناچیز است.
- هارنسهای مینیمال و ساده در بسیاری از موارد عملکردی رقابتی با جایگزینهای گرانقیمت و پرامکانات دارند.
- بررسیها روی ۲۱ ترکیب مختلف نشان داد که توسعهدهندگان باید مدل و هارنس را به عنوان یک سیستم یکپارچه ارزیابی کنند، زیرا مدلها لزوماً در محیط سازنده خودشان بهترین عملکرد را ندارند.
ممکن است دو توسعهدهنده از یک مدل مشخص برای انجام وظیفهای یکسان استفاده کنند، اما در نهایت هزینههای استنتاج (inference costs) بسیار متفاوتی بپردازند.
این تفاوت میتواند ناشی از «هارنس» (Harness) یا همان بستر اجرایی باشد. اینکه از Codex، Claude Code، Pi یا هارنسهای دیگر استفاده کنید، تفاوت چشمگیری ایجاد میکند.
بررسیهای جدید نشان میدهد که هارنسهای ساده میتوانند بهطور شگفتآوری رقابتی باشند؛ درحالیکه محیطهای پیچیدهتر، هزینههای قابلتوجهی را در ازای دستاوردهای اندک به کاربر تحمیل میکنند. همچنین مشخص شده است که مدلها لزوماً بهترین عملکرد خود را در هارنس اختصاصی سازنده خودشان ارائه نمیدهند.
در این گزارش به بررسی پیامدهای این موضوع در انتخاب پشتههای نرمافزاری ایجنتهای کدنویسی پرداخته شده است.
چگونه هنگام انتخاب ایجنتهای کدنویسی از «مالیات هارنس» جلوگیری کنیم؟
ارجاع یک وظیفه برنامهنویسی به یک مدل واحد اما در هارنسهای متفاوت، میتواند هزینه استنتاج آن را تا ۵ برابر تغییر دهد، بدون آنکه تاثیر مشابهی در میزان موفقیت وظیفه داشته باشد. این یافته کلیدی HarnessTax است؛ پژوهش جدیدی که میزان تاثیر نرمافزارهای احاطهکننده مدلهای هوش مصنوعی را بر عملکرد و هزینه ایجنتهای کدنویسی آزمایش میکند.
هارنس لایهای است که دستورالعملها، ابزارها، مدیریت حافظه و کانتکست مدل و نحوه اجرای یک وظیفه توسط ایجنت را تعیین میکند. هنگام انتخاب بین Claude Code، Codex CLI، Pi و سایر ایجنتهای کدنویسی، شما در واقع دو جزء را همزمان انتخاب میکنید: یک مدل و یک هارنس.
نتایج این پژوهش سه قاعده سرانگشتی مفید را پیشنهاد میدهد:
- انتخاب هارنس میتواند تغییرات هزینه را بسیار بیشتر از مجموع موفقیتها جابهجا کند.
- یک هارنس مینیمال میتواند با جایگزینهای پرامکانات و پیچیده رقابت کند.
- یک مدل لزوماً بهترین عملکرد خود را در هارنس ساختهشده توسط ارائهدهنده خودش به نمایش نمیگذارد.
برای توسعهدهندگان، درس کلیدی این است که مدل و هارنس را به عنوان یک سیستم یکپارچه ارزیابی کنند، نه اینکه صرفاً جفتشدگیهای پیشفرض را بپذیرند.
پژوهش HarnessTax چه چیزی را آزمایش کرد؟
محققان در مجموع ۲۱ ترکیب مختلف از مدل و هارنس را آزمایش کردند که شامل ۷ مدل و ۳ هارنس Claude Code، Codex CLI و Pi بود. آنها بهطور تصادفی ۳۰ وظیفه را از SWE-bench Lite (که توانایی یک ایجنت در رفع مشکلات نرمافزاری را میسنجد) و ۳۰ وظیفه را از Terminal-Bench 2.0 (که وظایف خط فرمان را آزمایش میکند) انتخاب کردند.
محققان هم میزان موفقیت وظایف و هم هزینه توکنها را بر اساس قیمتگذاری API اندازهگیری کردند. این رویکرد باعث میشود تا به جای ترکیب اثر هارنس با تفاوتهای قیمتگذاری محصولات، مشخص شود که آیا یک هارنس خاص باعث مصرف توکن بیشتری توسط همان مدل میشود یا خیر.
یافته اول: هارنس میتواند قبضها را بیشتر از امتیازها تغییر دهد
در آزمون SWE-bench Lite، مدل Claude Fable 5 توانست ۹۷٫۸ درصد از تلاشها را با Claude Code و ۹۶٫۷ درصد را با Pi با موفقیت حل کند. اما متوسط هزینه هر تلاش با Claude Code حدود ۱٫۳۳ دلار و با Pi تنها ۰٫۶۷ دلار بود. این بدان معناست که برای مشاهده تنها ۱٫۱ درصد تفاوت در موفقیت وظیفه، تقریباً دو برابر هزینه بیشتری پرداخت شده است.
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.