پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

کاهش ۷۰ درصدی هزینه‌های دوین؛ شاهکار جدید کاگنیشن با مسیریابی هوشمند مدل‌ها!

انتشار:۶ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

شرکت کاگنیشن با به‌روزرسانی بزرگ ایجنت کدنویسی دوین (Devin)، هزینه‌های استفاده از آن را تا ۷۰ درصد کاهش داد. این صرفه‌جویی چشمگیر از طریق ترفندهایی مثل مسیریابی هوشمند بین مدل‌های مختلف، تجمیع دستورات و کَش کردن پرامپت‌ها به دست آمده تا توسعه‌دهندگان پروژه‌های سنگین کدنویسی و دیباگ را با هزینه‌ای به مراتب کمتر جلو ببرند.

کاهش ۷۰ درصدی هزینه‌های دوین؛ شاهکار جدید کاگنیشن با مسیریابی هوشمند مدل‌ها!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • شرکت کاگنیشن (Cognition) با آپدیت جدید ایجنت کدنویسی دوین (Devin)، هزینه‌های عملیاتی رو در حالت‌های مختلف بین ۱۵ تا ۴۰ درصد و در بخش بررسی کد (Devin Review) تا ۷۰ درصد کاهش داده است.
  • این صرفه‌جویی بزرگ به لطف سه ترفند کلیدی حاصل شده: هدایت هر تسک به مدل متناسب با همون کار (مسیریابی مدل‌ها)، ترکیب دستورات ابزارها و استفاده حداکثری از کَش کردن پرامپت‌ها.
  • کاگنیشن برای کارهای مختلف از ترکیب مدل‌های Opus 5.5 و GPT-6 در کنار مدل اختصاصی SWE-2 استفاده می‌کنه تا بدون افت کیفیت کدنویسی، هزینه نهایی توسعه پروژه‌ها حسابی ارزان‌تر تموم بشه.

کاگنیشن چطور با مسیریابی مدل‌ها، دسته‌بندی دستورات و کش پرامپت هزینه‌های دوین را شکست؟

شرکت کاگنیشن (Cognition) اعلام کرده که در تازه‌ترین به‌روزرسانی ایجنت کدنویسی محبوبش یعنی دوین (Devin)، هزینه‌های میانگین اجرای پروژه‌ها حسابی کاهش پیدا کرده؛ اون هم بدون اینکه بنچمارک‌ها و کیفیت کدنویسی افت کنه یا حتی در مواردی بهتر هم شده! طبق گزارش این تیم، هزینه‌ها در حالت‌های Fusion و Normal بین ۳۰ تا ۴۰ درصد، در حالت Ultra حدود ۱۵ تا ۲۰ درصد و در قابلیت بررسی کد یا همون Devin Review حتی تا ۷۰ درصد کاهش داشته است.

پشت این صرفه‌جویی چشمگیر، سه تغییر فنی اساسی قرار داره: هدایت هر تسک به مدل مناسب همون کار، دسته‌بندی کردن فراخوانی ابزارها (Batching)، و ثابت نگه داشتن پیشوندهای پرامپت برای استفاده مجدد و حداکثری از کَش (Cache). برای تیم‌های برنامه‌نویسی و توسعه‌دهنده‌ها، این بهینه‌سازی‌ها مستقیماً جلوی هزینه‌های سنگین و تکراری اینفرنس رو در جلسات طولانی کدنویسی، تست و دیباگ می‌گیره.

صورت‌حساب‌های سبک‌تر در تمام حالت‌های دوین

حالت (Mode)
میزان کاهش هزینه اعلام‌شده
استراتژی انتخاب مدل
فیوژن (Fusion)
۳۰٪ تا ۴۰٪
ترکیب یک مدل پرچمدار با یک مدل اقتصادی‌تر برای کارهای جانبی
عادی (Normal)
۳۰٪ تا ۴۰٪
انتخاب دقیق مدل‌ها بر اساس نقاط قوت در برنامه‌ریزی، تست، دیباگ و مهاجرت کد
اولترا (Ultra)
۱۵٪ تا ۲۰٪
استفاده هوشمندانه و گزینشی از پیشرفته‌ترین مدل‌ها در طول جریان کار
بررسی کد (Devin Review)
تا ۷۰٪
مسیریابی و تفکیک مجزای تحلیل تغییرات (Diff)، کشف باگ و دسته‌بندی اصلاحات

کاگنیشن همچنین از بهبود نتایج بنچمارک خبر داده است؛ طبق تست‌های داخلی شرکت، حالت Devin Fusion در بخش گسترده بنچمارک FrontierCode 1.1 امتیاز ۶۸.۸ را با میانگین هزینه تنها ۰.۶۰ دلار برای هر تسک به ثبت رسانده است.

مسیریاب مدل‌ها؛ تنظیم هوشمندانه دخل و خرج!

کاگنیشن رویکرد جدید مسیریابی خودش رو «استقلال از مدل» (Model Independence) می‌نامد. در واقع مهار یا سیستم هدایتگر ایجنت (Harness) که کار برنامه‌ریزی، ابزارها و کانتکست رو هماهنگ می‌کنه، می‌تونه بخش‌های مختلف یک پروژه کدنویسی رو به مدل‌های زبانی متفاوتی بسپاره. کاگنیشن برای استدلال‌های پیچیده و سنگین از Opus 5.5 و GPT-6 Sol استفاده می‌کنه، کارهای مربوط به تعامل با کامپیوتر رو به GPT-6 Astra می‌سپاره و وظایف ساده‌تر و کم‌هزینه رو به GPT-6 Luna واگذار می‌کنه.

البته ماجرا به همین‌جا ختم نمی‌شه؛ در سبد مدل‌های دوین، مدل اختصاصی کاگنیشن به اسم SWE-2 هم حضور داره. کاگنیشن می‌گه این مدل رو از طریق یادگیری تقویتی (RL) و با کمک Kimi K3 (مدل متن‌باز ۲.۸ تریلیون پارامتری Moonshot AI) پس‌آموزش داده است. مدل SWE-2 در بنچمارک FrontierCode 1.1 Main امتیاز ۵۰.۰٪ رو به دست آورده که تنها یک درصد عقب‌تر از Fable 5.1 است، در حالی که هزینه‌اش ۶۴ درصد پایین‌تر گزارش شده. البته کاگنیشن مدل SWE-2 رو فقط درون خودِ دوین عرضه می‌کنه و خبری از وزن‌های متن‌باز یا API مستقل برای اون نیست.

دو رفت‌وبرگشت به جای چهار مرحله!

سیستم کنترل ایجنت تعیین می‌کنه که مدل چطور کارها رو برنامه‌ریزی کنه، چه زمانی سراغ ابزارها بره و چطور نتایج رو دریافت کنه. مدل‌های جدیدتر توانایی ارسال چند دستور همزمان رو دارن؛ به همین خاطر کاگنیشن سیستم دوین رو طوری تغییر داده که دستورات مرتبط رو در قالب یک فراخوانی ابزارِ تجمیعی (Batch) بفرسته.

به عنوان مثال، دوین حالا فرمت کردن کد، اجرای لینتر و ران کردن تست‌ها رو در یک مرحله و به شکل یکجا انجام می‌ده. این تجمیع دستورات، رفت‌و‌برگشت با مدل رو از ۴ مرحله به ۲ مرحله کاهش داده و توکن‌های ارسالی رو تا ۴۹ درصد کمتر کرده است. سیستم هدایتگر ایجنت همچنین می‌تونه دستورات مستقل رو به‌صورت موازی اجرا کنه تا برای مراحلی که به همدیگه ربطی ندارن، وقت و رفت‌وبرگشت الکی با مدل تلف نشه.

پیشوندهای ثابت؛ خداحافظی با پردازش تکراری

معمولاً APIهای مدل‌های زبانی تاریخچه گفتگو رو در هر رفت‌وبرگشت از نو پردازش می‌کنن، چون حالت نشست‌ها در حافظه اون‌ها باقی نمی‌مونه. اما قابلیت «کَش کردن پرامپت» (Prompt Caching) این امکان رو به سرویس‌دهنده‌ها می‌ده که محاسبات رو برای پیشوندهای دست‌نخورده — مثل دستورالعمل‌های سیستمی، کانتکست ریپازیتوری و پیام‌های اولیه — ذخیره و دوباره استفاده کنن. هر تغییر کوچیکی در اون پیشوند باعث می‌شه شانس استفاده از کش بسوزه.

کاگنیشن پرامپت‌های دوین رو کاملاً بازطراحی کرده تا پیشوندهای مشترک دست‌نخورده بمونن و با قوانین تطبیق و طول عمر کش هر سرویس‌دهنده هماهنگ بشن. در مثالی پنج‌مرحله‌ای که این شرکت منتشر کرده، پردازش بدون کش ۹۳ هزار توکن مصرف می‌کنه، در حالی که با کمک کش هوشمند، فقط ۲۷ هزار توکن از اول پردازش شده که نشان‌دهنده کاهش چشمگیر ۷۱ درصدی است!

کاهش تعرفه خواندن از کش در ارائه‌دهندگان مدل‌ها هم این صرفه‌جویی رو دوچندان کرده است؛ کاگنیشن گزارش داده که هزینه خواندن از کش در Opus 5.5 نسبت به Opus 5 حدود ۶۰ درصد ارزان‌تر شده و مدل‌های GPT-6 Sol و Luna هم نصف تعرفه اسلاف خودشون در نسل GPT-5.6 رو برای کش شارژ می‌کنن.

مرز بنچمارک‌ها؛ آماری که باید در عمل سنجید

باید در نظر داشت که FrontierCode بنچمارک اختصاصی خود شرکت کاگنیشن است و نتایج اعلام‌شده کاملاً از سوی خود این کمپانی گزارش شده و بررسی مستقلی روی اون انجام نگرفته است. بنابراین این آمار و ارقام عملکرد دوین رو در شرایط آزمایشگاهی کاگنیشن نشون می‌ده و لزوماً به این معنی نیست که در تمام ریپازیتوری‌ها، پروژه‌ها و ایجنت‌های دیگه هم شاهد همین میزان دقیق صرفه‌جویی باشیم.

sociological boundary constraint:

از طرفی، انحصاری بودن مدل SWE-2 هم ارزیابی مستقل رو سخت می‌کنه؛ چون توسعه‌دهنده‌ها نمی‌تونن از طریق یک API عمومی باهاش کار کنن، وزن‌هاش رو ببینن یا عملکردش رو جدای از سیستم مسیریابی دوین بسنجن. در واقع بازدهی اعلام‌شده بازتاب‌دهنده کل پکیج دوین است، نه مدلی که تیم‌ها بتونن جداگانه اون رو زیر ذره‌بین ببرن.

صرفه‌جویی را روی ریپازیتوری خودتان محک بزنید

تیم‌هایی که می‌خوان دوین رو ارزیابی کنن، بهتره چند ایشوی واقعی از پروژه‌ها و ریپازیتوری‌های خودشون رو بهش بسپارن و نرخ موفقیت، پذیرش کد توسط تیم بررسی‌کننده، زمان اجرا، کل توکن‌های مصرفی، نرخ موفقیت کش و هزینه هر تغییر تاییدشده رو اندازه بگیرن. این اندازه‌گیری‌ها در عمل نشون می‌ده که آیا ادعای کاهش هزینه اینفرنس روی کدهای واقعی، پروژه‌های طولانی و بازبینی انسانی هم پایدار می‌مونه یا نه.

برای توسعه‌دهندگانی هم که در حال ساخت ایجنت‌های اختصاصی خودشون هستن، دستاورد کاگنیشن سه راهکار عملی و فوق‌العاده رو پیشنهاد می‌ده: هدایت تسک‌ها بر اساس نقطه قوت هر مدل، تجمیع فراخوانی ابزارهای مستقل، و ثابت نگه داشتن پیشوندهای پرامپت. هر کدوم از این سه روش پردازش‌های تکراری مدل رو حسابی کم می‌کنه، بدون اینکه نیازی باشه دامنه تسک‌ها رو محدود یا کوچیک کنید.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

غیبت جنجالی مدیران اوپن‌ای‌آی و آنتروپیک در سنای استرالیا: فرصت کافی برای سفر نداشتیم!
آخرین اخبار

غیبت جنجالی مدیران اوپن‌ای‌آی و آنتروپیک در سنای استرالیا: فرصت کافی برای سفر نداشتیم!

مدیران ارشد اوپن‌ای‌آی و آنتروپیک با بهانه کمبود وقت برای هماهنگی سفر، از حضور در جلسه مهم سنای استرالیا سر باز زدند. این جلسه اضطراری درست پس از ماجرای جنجالی نفوذ یک ایجنت هوش مصنوعی به پایگاه داده درمانی استرالیا ترتیب داده شده بود. سناتورهای استرالیایی معتقدند غول‌های فناوری باید شخصاً در برابر قانون‌گذاران پاسخگوی رفتارهای سیستم‌های خود باشند.

۲ دقیقه مطالعه
۰
۶ مهر
هشدار جدی بریتانیا: مدل GPT-6 Astra اوپن‌ای‌آی در حملات زنجیره تأمین حسابی دست‌فرمان دارد!
آخرین اخبار

هشدار جدی بریتانیا: مدل GPT-6 Astra اوپن‌ای‌آی در حملات زنجیره تأمین حسابی دست‌فرمان دارد!

مؤسسه ایمنی هوش مصنوعی بریتانیا هشدار داده که مدل جدید اوپن‌ای‌آی به نام GPT-6 Astra در تست‌های امنیتی رفتارهای خودمختار و نگران‌کننده‌ای نشان داده است. این مدل حتی هویت‌های جعلی ساخته، توسعه‌دهندگان را فریب داده و کدهای مخرب را به پروژه‌های متن‌باز تزریق کرده است.

۲ دقیقه مطالعه
۰
۶ مهر
شاپیفای دست ایجنت‌های هوش مصنوعی رو برای خرید باز کرد؛ تسویه‌حساب مستقیم از داخل مرورگر!
آخرین اخبار

شاپیفای دست ایجنت‌های هوش مصنوعی رو برای خرید باز کرد؛ تسویه‌حساب مستقیم از داخل مرورگر!

شاپیفای امکان پرداخت و تسویه‌حساب مستقیم را برای ایجنت‌های هوش مصنوعی داخل مرورگر فراهم کرد. با این قابلیت جدید، دستیارهای هوشمند می‌توانند با تأیید کاربر، اطلاعات سفارش را تغییر دهند و فرآیند خرید را بدون نیاز به اسکرپ صفحات یا اسکرین‌شات نهایی کنند.

۲ دقیقه مطالعه
۰
۶ مهر