پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

بررسی پدیده «مالیات هارنس» در ایجنت‌های کدنویسی: چگونه هزینه استنتاج مدل‌ها تا ۵ برابر می‌شود؟

انتشار:۳۱ شهریور ۱۴۰۵(۶ روز پیش)
۳ دقیقه زمان مطالعه
۰ دیدگاه

پژوهش‌های جدید نشان می‌دهد که بستر اجرایی یا «هارنس» ایجنت‌های کدنویسی می‌تواند هزینه استفاده از یک مدل هوش مصنوعی را تا ۵ برابر افزایش دهد، بدون آنکه دستاورد چشمگیری در میزان موفقیت وظایف برنامه‌نویسی به همراه داشته باشد.

بررسی پدیده «مالیات هارنس» در ایجنت‌های کدنویسی: چگونه هزینه استنتاج مدل‌ها تا ۵ برابر می‌شود؟

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • انتخاب بستر اجرایی (هارنس) می‌تواند هزینه اجرای مدل‌های هوش مصنوعی را به شدت افزایش دهد، درحالی‌که تاثیر آن بر موفقیت وظایف بسیار ناچیز است.
  • هارنس‌های مینیمال و ساده در بسیاری از موارد عملکردی رقابتی با جایگزین‌های گران‌قیمت و پرامکانات دارند.
  • بررسی‌ها روی ۲۱ ترکیب مختلف نشان داد که توسعه‌دهندگان باید مدل و هارنس را به عنوان یک سیستم یکپارچه ارزیابی کنند، زیرا مدل‌ها لزوماً در محیط سازنده خودشان بهترین عملکرد را ندارند.

ممکن است دو توسعه‌دهنده از یک مدل مشخص برای انجام وظیفه‌ای یکسان استفاده کنند، اما در نهایت هزینه‌های استنتاج (inference costs) بسیار متفاوتی بپردازند.

این تفاوت می‌تواند ناشی از «هارنس» (Harness) یا همان بستر اجرایی باشد. اینکه از Codex، Claude Code، Pi یا هارنس‌های دیگر استفاده کنید، تفاوت چشمگیری ایجاد می‌کند.

بررسی‌های جدید نشان می‌دهد که هارنس‌های ساده می‌توانند به‌طور شگفت‌آوری رقابتی باشند؛ درحالی‌که محیط‌های پیچیده‌تر، هزینه‌های قابل‌توجهی را در ازای دستاوردهای اندک به کاربر تحمیل می‌کنند. همچنین مشخص شده است که مدل‌ها لزوماً بهترین عملکرد خود را در هارنس اختصاصی سازنده خودشان ارائه نمی‌دهند.

در این گزارش به بررسی پیامدهای این موضوع در انتخاب پشته‌های نرم‌افزاری ایجنت‌های کدنویسی پرداخته شده است.

چگونه هنگام انتخاب ایجنت‌های کدنویسی از «مالیات هارنس» جلوگیری کنیم؟

ارجاع یک وظیفه برنامه‌نویسی به یک مدل واحد اما در هارنس‌های متفاوت، می‌تواند هزینه استنتاج آن را تا ۵ برابر تغییر دهد، بدون آنکه تاثیر مشابهی در میزان موفقیت وظیفه داشته باشد. این یافته کلیدی HarnessTax است؛ پژوهش جدیدی که میزان تاثیر نرم‌افزارهای احاطه‌کننده مدل‌های هوش مصنوعی را بر عملکرد و هزینه ایجنت‌های کدنویسی آزمایش می‌کند.

هارنس لایه‌ای است که دستورالعمل‌ها، ابزارها، مدیریت حافظه و کانتکست مدل و نحوه اجرای یک وظیفه توسط ایجنت را تعیین می‌کند. هنگام انتخاب بین Claude Code، Codex CLI، Pi و سایر ایجنت‌های کدنویسی، شما در واقع دو جزء را هم‌زمان انتخاب می‌کنید: یک مدل و یک هارنس.

نتایج این پژوهش سه قاعده سرانگشتی مفید را پیشنهاد می‌دهد:

  • انتخاب هارنس می‌تواند تغییرات هزینه را بسیار بیشتر از مجموع موفقیت‌ها جابه‌جا کند.
  • یک هارنس مینیمال می‌تواند با جایگزین‌های پرامکانات و پیچیده رقابت کند.
  • یک مدل لزوماً بهترین عملکرد خود را در هارنس ساخته‌شده توسط ارائه‌دهنده خودش به نمایش نمی‌گذارد.

برای توسعه‌دهندگان، درس کلیدی این است که مدل و هارنس را به عنوان یک سیستم یکپارچه ارزیابی کنند، نه اینکه صرفاً جفت‌شدگی‌های پیش‌فرض را بپذیرند.

پژوهش HarnessTax چه چیزی را آزمایش کرد؟

محققان در مجموع ۲۱ ترکیب مختلف از مدل و هارنس را آزمایش کردند که شامل ۷ مدل و ۳ هارنس Claude Code، Codex CLI و Pi بود. آن‌ها به‌طور تصادفی ۳۰ وظیفه را از SWE-bench Lite (که توانایی یک ایجنت در رفع مشکلات نرم‌افزاری را می‌سنجد) و ۳۰ وظیفه را از Terminal-Bench 2.0 (که وظایف خط فرمان را آزمایش می‌کند) انتخاب کردند.

محققان هم میزان موفقیت وظایف و هم هزینه توکن‌ها را بر اساس قیمت‌گذاری API اندازه‌گیری کردند. این رویکرد باعث می‌شود تا به جای ترکیب اثر هارنس با تفاوت‌های قیمت‌گذاری محصولات، مشخص شود که آیا یک هارنس خاص باعث مصرف توکن بیشتری توسط همان مدل می‌شود یا خیر.

یافته اول: هارنس می‌تواند قبض‌ها را بیشتر از امتیازها تغییر دهد

در آزمون SWE-bench Lite، مدل Claude Fable 5 توانست ۹۷٫۸ درصد از تلاش‌ها را با Claude Code و ۹۶٫۷ درصد را با Pi با موفقیت حل کند. اما متوسط هزینه هر تلاش با Claude Code حدود ۱٫۳۳ دلار و با Pi تنها ۰٫۶۷ دلار بود. این بدان معناست که برای مشاهده تنها ۱٫۱ درصد تفاوت در موفقیت وظیفه، تقریباً دو برابر هزینه بیشتری پرداخت شده است.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر