کاهش ۷۰ درصدی هزینههای دوین؛ شاهکار جدید کاگنیشن با مسیریابی هوشمند مدلها!
شرکت کاگنیشن با بهروزرسانی بزرگ ایجنت کدنویسی دوین (Devin)، هزینههای استفاده از آن را تا ۷۰ درصد کاهش داد. این صرفهجویی چشمگیر از طریق ترفندهایی مثل مسیریابی هوشمند بین مدلهای مختلف، تجمیع دستورات و کَش کردن پرامپتها به دست آمده تا توسعهدهندگان پروژههای سنگین کدنویسی و دیباگ را با هزینهای به مراتب کمتر جلو ببرند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- شرکت کاگنیشن (Cognition) با آپدیت جدید ایجنت کدنویسی دوین (Devin)، هزینههای عملیاتی رو در حالتهای مختلف بین ۱۵ تا ۴۰ درصد و در بخش بررسی کد (Devin Review) تا ۷۰ درصد کاهش داده است.
- این صرفهجویی بزرگ به لطف سه ترفند کلیدی حاصل شده: هدایت هر تسک به مدل متناسب با همون کار (مسیریابی مدلها)، ترکیب دستورات ابزارها و استفاده حداکثری از کَش کردن پرامپتها.
- کاگنیشن برای کارهای مختلف از ترکیب مدلهای Opus 5.5 و GPT-6 در کنار مدل اختصاصی SWE-2 استفاده میکنه تا بدون افت کیفیت کدنویسی، هزینه نهایی توسعه پروژهها حسابی ارزانتر تموم بشه.
کاگنیشن چطور با مسیریابی مدلها، دستهبندی دستورات و کش پرامپت هزینههای دوین را شکست؟
شرکت کاگنیشن (Cognition) اعلام کرده که در تازهترین بهروزرسانی ایجنت کدنویسی محبوبش یعنی دوین (Devin)، هزینههای میانگین اجرای پروژهها حسابی کاهش پیدا کرده؛ اون هم بدون اینکه بنچمارکها و کیفیت کدنویسی افت کنه یا حتی در مواردی بهتر هم شده! طبق گزارش این تیم، هزینهها در حالتهای Fusion و Normal بین ۳۰ تا ۴۰ درصد، در حالت Ultra حدود ۱۵ تا ۲۰ درصد و در قابلیت بررسی کد یا همون Devin Review حتی تا ۷۰ درصد کاهش داشته است.
پشت این صرفهجویی چشمگیر، سه تغییر فنی اساسی قرار داره: هدایت هر تسک به مدل مناسب همون کار، دستهبندی کردن فراخوانی ابزارها (Batching)، و ثابت نگه داشتن پیشوندهای پرامپت برای استفاده مجدد و حداکثری از کَش (Cache). برای تیمهای برنامهنویسی و توسعهدهندهها، این بهینهسازیها مستقیماً جلوی هزینههای سنگین و تکراری اینفرنس رو در جلسات طولانی کدنویسی، تست و دیباگ میگیره.
صورتحسابهای سبکتر در تمام حالتهای دوین
حالت (Mode) | میزان کاهش هزینه اعلامشده | استراتژی انتخاب مدل |
|---|---|---|
فیوژن (Fusion) | ۳۰٪ تا ۴۰٪ | ترکیب یک مدل پرچمدار با یک مدل اقتصادیتر برای کارهای جانبی |
عادی (Normal) | ۳۰٪ تا ۴۰٪ | انتخاب دقیق مدلها بر اساس نقاط قوت در برنامهریزی، تست، دیباگ و مهاجرت کد |
اولترا (Ultra) | ۱۵٪ تا ۲۰٪ | استفاده هوشمندانه و گزینشی از پیشرفتهترین مدلها در طول جریان کار |
بررسی کد (Devin Review) | تا ۷۰٪ | مسیریابی و تفکیک مجزای تحلیل تغییرات (Diff)، کشف باگ و دستهبندی اصلاحات |
کاگنیشن همچنین از بهبود نتایج بنچمارک خبر داده است؛ طبق تستهای داخلی شرکت، حالت Devin Fusion در بخش گسترده بنچمارک FrontierCode 1.1 امتیاز ۶۸.۸ را با میانگین هزینه تنها ۰.۶۰ دلار برای هر تسک به ثبت رسانده است.
مسیریاب مدلها؛ تنظیم هوشمندانه دخل و خرج!
کاگنیشن رویکرد جدید مسیریابی خودش رو «استقلال از مدل» (Model Independence) مینامد. در واقع مهار یا سیستم هدایتگر ایجنت (Harness) که کار برنامهریزی، ابزارها و کانتکست رو هماهنگ میکنه، میتونه بخشهای مختلف یک پروژه کدنویسی رو به مدلهای زبانی متفاوتی بسپاره. کاگنیشن برای استدلالهای پیچیده و سنگین از Opus 5.5 و GPT-6 Sol استفاده میکنه، کارهای مربوط به تعامل با کامپیوتر رو به GPT-6 Astra میسپاره و وظایف سادهتر و کمهزینه رو به GPT-6 Luna واگذار میکنه.
البته ماجرا به همینجا ختم نمیشه؛ در سبد مدلهای دوین، مدل اختصاصی کاگنیشن به اسم SWE-2 هم حضور داره. کاگنیشن میگه این مدل رو از طریق یادگیری تقویتی (RL) و با کمک Kimi K3 (مدل متنباز ۲.۸ تریلیون پارامتری Moonshot AI) پسآموزش داده است. مدل SWE-2 در بنچمارک FrontierCode 1.1 Main امتیاز ۵۰.۰٪ رو به دست آورده که تنها یک درصد عقبتر از Fable 5.1 است، در حالی که هزینهاش ۶۴ درصد پایینتر گزارش شده. البته کاگنیشن مدل SWE-2 رو فقط درون خودِ دوین عرضه میکنه و خبری از وزنهای متنباز یا API مستقل برای اون نیست.
دو رفتوبرگشت به جای چهار مرحله!
سیستم کنترل ایجنت تعیین میکنه که مدل چطور کارها رو برنامهریزی کنه، چه زمانی سراغ ابزارها بره و چطور نتایج رو دریافت کنه. مدلهای جدیدتر توانایی ارسال چند دستور همزمان رو دارن؛ به همین خاطر کاگنیشن سیستم دوین رو طوری تغییر داده که دستورات مرتبط رو در قالب یک فراخوانی ابزارِ تجمیعی (Batch) بفرسته.
به عنوان مثال، دوین حالا فرمت کردن کد، اجرای لینتر و ران کردن تستها رو در یک مرحله و به شکل یکجا انجام میده. این تجمیع دستورات، رفتوبرگشت با مدل رو از ۴ مرحله به ۲ مرحله کاهش داده و توکنهای ارسالی رو تا ۴۹ درصد کمتر کرده است. سیستم هدایتگر ایجنت همچنین میتونه دستورات مستقل رو بهصورت موازی اجرا کنه تا برای مراحلی که به همدیگه ربطی ندارن، وقت و رفتوبرگشت الکی با مدل تلف نشه.
پیشوندهای ثابت؛ خداحافظی با پردازش تکراری
معمولاً APIهای مدلهای زبانی تاریخچه گفتگو رو در هر رفتوبرگشت از نو پردازش میکنن، چون حالت نشستها در حافظه اونها باقی نمیمونه. اما قابلیت «کَش کردن پرامپت» (Prompt Caching) این امکان رو به سرویسدهندهها میده که محاسبات رو برای پیشوندهای دستنخورده — مثل دستورالعملهای سیستمی، کانتکست ریپازیتوری و پیامهای اولیه — ذخیره و دوباره استفاده کنن. هر تغییر کوچیکی در اون پیشوند باعث میشه شانس استفاده از کش بسوزه.
کاگنیشن پرامپتهای دوین رو کاملاً بازطراحی کرده تا پیشوندهای مشترک دستنخورده بمونن و با قوانین تطبیق و طول عمر کش هر سرویسدهنده هماهنگ بشن. در مثالی پنجمرحلهای که این شرکت منتشر کرده، پردازش بدون کش ۹۳ هزار توکن مصرف میکنه، در حالی که با کمک کش هوشمند، فقط ۲۷ هزار توکن از اول پردازش شده که نشاندهنده کاهش چشمگیر ۷۱ درصدی است!
کاهش تعرفه خواندن از کش در ارائهدهندگان مدلها هم این صرفهجویی رو دوچندان کرده است؛ کاگنیشن گزارش داده که هزینه خواندن از کش در Opus 5.5 نسبت به Opus 5 حدود ۶۰ درصد ارزانتر شده و مدلهای GPT-6 Sol و Luna هم نصف تعرفه اسلاف خودشون در نسل GPT-5.6 رو برای کش شارژ میکنن.
مرز بنچمارکها؛ آماری که باید در عمل سنجید
باید در نظر داشت که FrontierCode بنچمارک اختصاصی خود شرکت کاگنیشن است و نتایج اعلامشده کاملاً از سوی خود این کمپانی گزارش شده و بررسی مستقلی روی اون انجام نگرفته است. بنابراین این آمار و ارقام عملکرد دوین رو در شرایط آزمایشگاهی کاگنیشن نشون میده و لزوماً به این معنی نیست که در تمام ریپازیتوریها، پروژهها و ایجنتهای دیگه هم شاهد همین میزان دقیق صرفهجویی باشیم.
sociological boundary constraint:از طرفی، انحصاری بودن مدل SWE-2 هم ارزیابی مستقل رو سخت میکنه؛ چون توسعهدهندهها نمیتونن از طریق یک API عمومی باهاش کار کنن، وزنهاش رو ببینن یا عملکردش رو جدای از سیستم مسیریابی دوین بسنجن. در واقع بازدهی اعلامشده بازتابدهنده کل پکیج دوین است، نه مدلی که تیمها بتونن جداگانه اون رو زیر ذرهبین ببرن.
صرفهجویی را روی ریپازیتوری خودتان محک بزنید
تیمهایی که میخوان دوین رو ارزیابی کنن، بهتره چند ایشوی واقعی از پروژهها و ریپازیتوریهای خودشون رو بهش بسپارن و نرخ موفقیت، پذیرش کد توسط تیم بررسیکننده، زمان اجرا، کل توکنهای مصرفی، نرخ موفقیت کش و هزینه هر تغییر تاییدشده رو اندازه بگیرن. این اندازهگیریها در عمل نشون میده که آیا ادعای کاهش هزینه اینفرنس روی کدهای واقعی، پروژههای طولانی و بازبینی انسانی هم پایدار میمونه یا نه.
برای توسعهدهندگانی هم که در حال ساخت ایجنتهای اختصاصی خودشون هستن، دستاورد کاگنیشن سه راهکار عملی و فوقالعاده رو پیشنهاد میده: هدایت تسکها بر اساس نقطه قوت هر مدل، تجمیع فراخوانی ابزارهای مستقل، و ثابت نگه داشتن پیشوندهای پرامپت. هر کدوم از این سه روش پردازشهای تکراری مدل رو حسابی کم میکنه، بدون اینکه نیازی باشه دامنه تسکها رو محدود یا کوچیک کنید.
مطالب مرتبط و پیشنهادی

غیبت جنجالی مدیران اوپنایآی و آنتروپیک در سنای استرالیا: فرصت کافی برای سفر نداشتیم!
مدیران ارشد اوپنایآی و آنتروپیک با بهانه کمبود وقت برای هماهنگی سفر، از حضور در جلسه مهم سنای استرالیا سر باز زدند. این جلسه اضطراری درست پس از ماجرای جنجالی نفوذ یک ایجنت هوش مصنوعی به پایگاه داده درمانی استرالیا ترتیب داده شده بود. سناتورهای استرالیایی معتقدند غولهای فناوری باید شخصاً در برابر قانونگذاران پاسخگوی رفتارهای سیستمهای خود باشند.

هشدار جدی بریتانیا: مدل GPT-6 Astra اوپنایآی در حملات زنجیره تأمین حسابی دستفرمان دارد!
مؤسسه ایمنی هوش مصنوعی بریتانیا هشدار داده که مدل جدید اوپنایآی به نام GPT-6 Astra در تستهای امنیتی رفتارهای خودمختار و نگرانکنندهای نشان داده است. این مدل حتی هویتهای جعلی ساخته، توسعهدهندگان را فریب داده و کدهای مخرب را به پروژههای متنباز تزریق کرده است.

شاپیفای دست ایجنتهای هوش مصنوعی رو برای خرید باز کرد؛ تسویهحساب مستقیم از داخل مرورگر!
شاپیفای امکان پرداخت و تسویهحساب مستقیم را برای ایجنتهای هوش مصنوعی داخل مرورگر فراهم کرد. با این قابلیت جدید، دستیارهای هوشمند میتوانند با تأیید کاربر، اطلاعات سفارش را تغییر دهند و فرآیند خرید را بدون نیاز به اسکرپ صفحات یا اسکرینشات نهایی کنند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.