پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ایجنت کدنویسی Delta با نصف درخواست‌ها رقبای خود را به چالش کشید؛ رقابت با Codex و Claude Code

انتشار:۴ مهر ۱۴۰۵(۲ روز پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

بنچمارک‌های جدید منتشرشده از ایجنت کدنویسی Delta نشان می‌دهد این بستر در تست‌های مبتنی بر ترمینال عملکردی برابر یا بهتر از Codex و Claude Code به نمایش گذاشته و در برخی سناریوها با نصف تعداد درخواست‌ها و سرعت بالاتر به نتیجه رسیده است.

ایجنت کدنویسی Delta با نصف درخواست‌ها رقبای خود را به چالش کشید؛ رقابت با Codex و Claude Code

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • برابری و پیشی گرفتن ایجنت کدنویسی Delta از رقبایی همچون Codex و Claude Code در بنچمارک‌های Terminal-Bench روی مدل‌های پیشرو.
  • کاهش ۵۰ درصدی تعداد درخواست‌های ارسالی به مدل و ۳۲ ثانیه صرفه‌جویی در زمان در تسک‌های هم‌روند.
  • تأکید بر نقش حیاتی معماری هارنس (Harness) در جبران مزیت شرکت‌های توسعه‌دهنده مدل مانند OpenAI و Anthropic.
  • ثبت نرخ خطای ۱.۵ درصدی در فراخوانی ابزارها توسط Delta و برتری در ایجاد کدهای تمیز و قابل بازبینی.

برابری عملکرد Delta با هارنس‌های بومی در تست‌های Zed

تیم توسعه‌دهنده ویرایشگر Zed به‌تازگی نتایج بنچمارک مربوط به Delta، ایجنت همکار کدنویسی خود را منتشر کرده است. بر اساس آزمایش‌های انجام‌شده، هارنس Delta در نرخ موفقیت حل تسک‌ها روی چهار مدل پیشرو، با Codex و Claude Code برابری کرده یا حتی از آن‌ها پیشی گرفته است؛ در حالی که هزینه آن به‌ازای هر تسک موفق بین ۰.۸۰ تا ۱.۱۲ برابر هارنس‌های بومی ثبت شده است. این گزارش بنچمارک همچنین مواردی را که معیارهای معمولِ نرخ قبولی نادیده می‌گیرند بررسی می‌کند: آرتیفکت‌های مخزن کد، فراخوانی‌های ناموفق ابزارها، تلاش‌های مجدد و زمان صرف‌شده.

کاهش مزیت انحصاری توسعه‌دهندگان مدل توسط Delta

تیم Zed مدل‌های GPT-5.6 Sol و GPT-6 Astra از OpenAI را در برابر Codex، و مدل‌های Claude Opus 5 و Claude Fable 5.1 را در برابر Claude Code مورد ارزیابی قرار داد. هر چهار مقایسه از بنچمارک Terminal-Bench 2.1 بهره برده‌اند؛ مجموعه‌آزمونی که توانایی یک ایجنت را در تکمیل تسک‌های مبتنی بر ترمینال می‌سنجد.

مدل
هارنس بومی
هزینه Delta به‌ازای هر قبولی
GPT-5.6 Sol
Codex
پایین‌تر
GPT-6 Astra
Codex
کمی بالاتر
Claude Opus 5
Claude Code
کمی بالاتر
Claude Fable 5.1
Claude Code
تقریباً برابر

در میان این چهار مدل، هزینه گزارش‌شده Delta به‌ازای هر تسک موفق بین ۰.۸۰ تا ۱.۱۲ برابر نتیجه هارنس‌های بومی بوده است. هزینه به‌ازای هر قبولی، هم هزینه‌های پردازش استنتاج مدل و هم تعداد تسک‌های موفق را در بر می‌گیرد.

برای مدل متن‌باز Kimi K3، شرکت Zed از مجموعه ۳۰ تسکی FrontierHarness استفاده کرد. بر اساس این گزارش، Delta از نظر نرخ قبولی از سایر هارنس‌های بررسی‌شده بهتر عمل کرد و در عین حال از نظر هزینه نیز رقابتی باقی ماند.

این بنچمارک‌ها توسط خود ناشر اجرا شده‌اند و دامنه آن‌ها محدود به تسک‌ها، مدل‌ها و پیکربندی‌های گزارش‌شده است. بازآزمایی‌های مستقل و ارزیابی در مخازن کد بزرگ‌تر نشان خواهد داد که این یافته‌ها تا چه اندازه در محیط‌های واقعی توسعه نرم‌افزار قابل تعمیم خواهند بود.

نقش کلیدی هارنس در نحوه اجرای فرایندها

هارنس در ایجنت‌های کدنویسی، لایه نرم‌افزاری رابط میان مدل و محیط توسعه است. این بخش ابزارهای در دسترس را مشخص می‌کند، دستورات ترمینال را به اجرا درمی‌آورد، فایل‌ها را ویرایش می‌کند، تلاش‌های مجدد را مدیریت می‌نماید، کانتکست را زنده نگه می‌دارد و پرامپت‌هایی را که رفتار مدل را هدایت می‌کنند در اختیار آن می‌گذارد.

شرکت‌های توسعه‌دهنده مدل می‌توانند سیستم‌های خود را همگام با هارنس‌های اختصاصی‌شان آموزش دهند و تنظیم کنند و خطاهای داخلی را بررسی نمایند. شرکت‌های ارائه‌دهنده ابزارهای توسعه به چنین دسترسی‌هایی مجهز نیستند؛ بنابراین دستیابی به نتایجی قابل مقایسه نشان می‌دهد که معماری و طراحی هارنس می‌تواند بخشی از برتری ذاتی سازندگان مدل را جبران کند.

پنهان ماندن کیفیت پیاده‌سازی در سایه نمره قبولی

بنچمارک Terminal-Bench تنها بررسی می‌کند که آیا محیط به وضعیت نهایی مورد انتظار رسیده است یا خیر. این شیوه نمره‌دهی ممکن است به ایجنت‌هایی که کدهای کاملاً متفاوتی در مخزن بر جای می‌گذارند، نمره قبولی یکسانی بدهد.

مدل و تسک
هارنس
رفتار ثبت‌شده
GPT-5.6 Sol، code-from-image
Codex
پاسخ را با یک دستور موقت Node محاسبه کرد و نتیجه ۶۴ کاراکتری را در output.txt نوشت. هیچ فایل پیاده‌سازی باقی نماند.
GPT-5.6 Sol، code-from-image
Delta
یک فایل solution.py ایجاد کرد، آن را اجرا نمود و خروجی را با فایل هدف تطبیق داد.
Claude Fable 5.1، تسک هشینگ
Claude Code
با استفاده از printf هش محاسبه‌شده قبلی را مستقیماً در فایل پاسخ قرار داد.
Claude Fable 5.1، تسک هشینگ
Delta
اسکریپت هشینگ را به‌گونه‌ای تنظیم کرد که فایل پاسخ را مستقیماً بنویسد.

فایل‌های پیاده‌سازیِ قابل بازبینی به تیم‌های مهندسی امکانی می‌دهند تا کد را بررسی، تست، بازاجرا و اصلاح کنند؛ در حالی که یک دستور موقت ترمینال شاید معیارهای بنچمارک را ارضا کند، اما عملاً هیچ کد قابل استفاده مجددی در مخزن پروژه باقی نمی‌گذارد.

محاسبه نشدن تلاش‌های مجدد در نمره‌دهی نهایی

بر اساس گزارش Zed، هارنس‌ها می‌توانند فراخوانی‌های ناموفق ابزارها را درون خود جذب و پیش از دستیابی به نتیجه نهایی مجدداً تکرار کنند؛ موضوعی که باعث می‌شود معیارهای مبتنی بر نرخ قبولی، تعداد درخواست‌های اضافی و تأخیر ناشی از آن را نادیده بگیرند. این شرکت نرخ شکست فراخوانی ابزار در Claude Code را بالا توصیف کرده و نرخ خطای Delta را روی مدل‌های Anthropic حدود ۱.۵ درصد اندازه‌گیری کرده است. همچنین Zed اعلام کرده هر دو هارنس توکن‌های مدل را با سرعتی یکسان دریافت می‌کنند و بخش عمده تأخیرِ محسوس برای کاربران ناشی از اجرای ابزارها و مدیریت تلاش‌های مجدد است.

سیستم DeltaDB تاریخچه نسخه‌های فایل و اقدامات پیشین ایجنت را ذخیره می‌کند. هنگامی که یک تغییر نرم‌افزاری (Patch) با دو خط کاملاً مشابه تطابق داشته باشد، این کانتکست به Delta کمک می‌کند تا خط مورد نظر را به‌درستی انتخاب کند. همچنین اگر یکی از اعضای تیم پس از خوانده شدن فایل توسط مدل، خطی را ویرایش کند، Delta محتوای قدیمی‌شده را تشخیص داده و پیش از اعمال ویرایش، به مدل دستور می‌دهد فایل را مجدداً مطالعه کند.

کاهش ۵۰ درصدی تعداد درخواست‌ها در یک تسک نمونه

در یکی از تسک‌های Terminal-Bench که به شمارش توکن‌ها در یک مجموعه داده Hugging Face اختصاص داشت، مدل GPT-6 Astra این وظیفه را از طریق هر دو بستر Codex و Delta به انجام رساند. با این حال، لاگ‌های اجرای این دو در تعداد درخواست‌ها، مدیریت دستورات و مدت‌زمان کل تفاوت‌های محسوسی داشتند.

هارنس
درخواست‌های مدل
الگوی اجرا
زمان صرف‌شده
Codex
۱۴
استفاده از چندین فراخوانی ابزار در هفت درخواست و صرف پنج درخواست برای بررسی دستوراتی که همچنان در حال اجرا بودند.
۱۱۰ ثانیه
Delta
۷
مطالعه فایل README هم‌زمان با بررسی پکیج‌های نصب‌شده، سپس نصب پکیج‌های ناموجود همگام با دریافت فهرست دیتاست و تنظیمات توکنایزر به‌صورت موازی.
۷۸ ثانیه

شرکت Zed این تفاوت چشمگیر را ناشی از ابزار ترمینالی می‌داند که منتظر اتمام اجرای دستورات می‌ماند، در برابر هارنسی که می‌تواند عملیات‌های مستقل را به‌شکل هم‌روند و موازی به اجرا درآورد. در این مثال، Delta به هفت درخواست کمتر و ۳۲ ثانیه زمان کوتاه‌تر نیاز داشت؛ هرچند بنچمارک Terminal-Bench هر دو اجرا را با نتیجه قبولی یکسان ارزیابی کرد.

معیارهای جامع‌تر برای ارزیابی عملکرد ایجنت‌ها

انتخاب یک ایجنت کدنویسی نیازمند معیارهایی است که چرخه کامل توسعه نرم‌افزار را در بر بگیرد؛ از جمله قابلیت اطمینان، تأخیر و کیفیت کدهای ثبت‌شده. معیارهای ارزیابی کاربردی عبارت‌اند از:

  • موفقیت در تسک: نرخ قبولی در مخازن کد استاندارد و در طول اجراهای مکرر.
  • بهره‌وری هزینه: مجموع هزینه صرف‌شده به‌ازای هر تسک موفق، با احتساب تلاش‌های ناموفق و تکرارها.
  • میزان تأخیر: زمان واقعی سپری‌شده، تعداد درخواست‌ها به مدل، فرآیندهای Polling و زمان انتظار برای دستورات.
  • پایداری ابزارها: ویرایش‌های ناموفق، فراخوانی‌های ردشده، خواندن داده‌های قدیمی و توانایی بازیابی از خطا.
  • کیفیت خروجی مخزن: کدهای قابل بازبینی، تست‌ها، اسکریپت‌های قابل بازتولید و حداقل نیاز به پاکسازی مجدد.
  • همکاری تیمی: نحوه عملکرد زمانی که فایل‌ها در حین اجرا تغییر می‌کنند یا چندین برنامه‌نویس کدهای مرتبط را ویرایش می‌نمایند.

پروژه‌های پژوهشی مانند HarnessTax و FrontierHarness در تلاش‌اند تا سهم مدل و هارنس را به‌طور مستقل اندازه‌گیری کنند. تحقیقات آن‌ها نشان‌دهنده نیاز فزاینده به بنچمارک‌هایی است که عملکرد کل سیستم ایجنت را شفاف سازند، نه اینکه تنها یک نمره تجمیعی ساده را گزارش دهند.

تیم Zed اعلام کرده است که ارزیابی‌های آتی این شرکت فراتر از Terminal-Bench خواهد رفت و بر چرخه ویرایش تعاملی و هم‌زمان تمرکز خواهد داشت؛ بستری که Delta به‌طور ویژه برای آن طراحی شده است. تسک‌هایی شامل ویرایش‌های هم‌روند، مدیریت تغییرات فایل‌ها و پچ‌های قابل بازبینی می‌توانند این ادعاها را به چالش بکشند. در چارچوب بنچمارک‌های فعلی، نتایج نشان می‌دهند که انتخاب هارنس می‌تواند حتی در صورت ثابت ماندن مدل زیربنایی، نرخ تکمیل تسک، هزینه، تأخیر و کیفیت خروجی پروژه را به‌کلی دگرگون کند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر