ورود مدل GPT-6.1 Sol به دوین؛ کاهش ۵۷ درصدی هزینههای برنامهنویسی با هوش مصنوعی!
شرکت کاگنیشن مدل جدید GPT-6.1 Sol محصول اوپنایآی را به مهندس نرمافزار هوشمند دوین اضافه کرد. این بهروزرسانی بزرگ، ضمن حفظ دقت و کیفیت کدنویسی، هزینههای استنتاج را تا ۵۷ درصد کاهش میدهد و تحول چشمگیری در اقتصاد ایجنتهای کدنویس ایجاد میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل تازهنفس GPT-6.1 Sol به نسخههای دسکتاپ و خط فرمان ایجنت دوین (Devin) اضافه شد و عملکردی بسیار نزدیک به نسل قبلی خود به نمایش گذاشت.
- با این مدل، هزینه اجرای تسکهای برنامهنویسی بین ۴۴ تا ۵۷ درصد کاهش پیدا میکنه و در حالت تنظیمات متوسط، هزینه هر تسک به ۳۱ سنت میرسه.
- این جهش قیمتی کارایی حلقههای خودکار برنامهنویسی رو دوچندان میکنه و انجام پروژههای حجیم و روتین کدنویسی رو فوقالعاده مقرونبهصرفه میسازه.
ورود مدل GPT-6.1 Sol به دوین؛ کارایی بالا با هزینهای بهینهتر
شرکت کاگنیشن (Cognition) رسماً مدل GPT-6.1 Sol محصول اوپنایآی (OpenAI) را به اپلیکیشنهای دوین، از جمله نسخه دسکتاپ (Devin Desktop) و نسخه خط فرمان (Devin CLI)، اضافه کرد. طبق یادداشتهای انتشار کاگنیشن، این مدل از نظر کیفیت و توان کدنویسی تقریباً دوشادوش نسلهای پیشین خود حرکت میکند، اما هزینه استنتاج گزارششده به ازای هر تسک بنچمارک را به شکلی چشمگیر کاهش میدهد.
امتیازهای برابر، اما با قیمتی به مراتب اقتصادیتر
در بنچمارک FrontierCode 1.1 Extended که متعلق به کاگنیشن است، مدل GPT-6.1 Sol در سطح استدلال متوسط (Medium) امتیاز ۶۰.۴ درصد را ثبت کرده است. برای مقایسه، مدلهای GPT-6 Sol و GPT-5.6 Sol به ترتیب امتیازهای ۶۰.۷ و ۶۰.۶ درصد را به ثبت رسانده بودند. پارامتر تلاش استدلالی (Reasoning Effort) میزان منابع پردازشی که مدل برای برنامهریزی، بررسی و اعتبارسنجی پاسخ صرف میکند را کنترل و تنظیم میکند.
مدل | سطح استدلال | امتیاز بنچمارک | هزینه هر تسک |
|---|---|---|---|
GPT-6.1 Sol | متوسط (Medium) | ۶۰.۴٪ | ۰.۳۱ دلار |
GPT-6.1 Sol | پایین (Low) | ۵۸.۱٪ | ۰.۲۱ دلار |
GPT-6 Sol | حداکثر (Maximum) | ۶۰.۷٪ | ۱.۶۶ دلار |
GPT-6 Sol | پایین (Low) | ۵۰.۵٪ | نامشخص |
کاگنیشن گزارش داده که مدل GPT-6.1 Sol در تنظیمات استدلالی همسطح، بین ۴۴ تا ۵۷ درصد ارزانتر از GPT-6 Sol تمام میشود؛ در حالی که اختلاف امتیاز آنها در بنچمارک حتی به یک درصد هم نمیرسد. جالبتر اینکه مقایسه مستقیم GPT-6.1 Sol در سطح استدلال متوسط با GPT-6 Sol در حالت حداکثری، از افت شدید ۸۱ درصدی هزینهها (از ۱.۶۶ دلار به ۳۱ سنت) خبر میدهد؛ هرچند این مقایسه با دو تنظیمات متغیر انجام شده است.
در سطح استدلال پایین نیز GPT-6.1 Sol نسبت به GPT-6 Sol رشد چشمگیر ۷.۶ درصدی را ثبت کرده است. کاگنیشن تأکید کرده که نتیجه ۵۸.۱ درصدی این مدل در حال حاضر بالاترین امتیاز ثبتشده در بنچمارک FrontierCode در میان تمامی مدلهایی است که کمتر از ۳۰ سنت برای هر تسک خرج روی دست کاربر میگذارند.
معیار «قابل ادغام» (Mergeable) چیست و چطور سنجیده میشود؟
بنچمارک FrontierCode برای ارزیابی عملکرد مدلها، از تسکهای واقعی مهندسی نرمافزار که توسط نگهدارندههای پروژههای متنباز آماده شدهاند، استفاده میکند. مجموعهای هماهنگ از آزمونهای واحد (Unit Tests)، اعتبارسنجیهای معیاری و بررسیکنندههای خودکار، کدهای تولیدشده را زیر ذرهبین قرار میدهند و در صورتی که پچ نهایی شروط ادغام پروژه را پاس کند، تسک موفق اعلام میشود.
در ویرایش ۱.۱ این بنچمارک، اجرای تسکهایی که به منابع آنلاین حاوی راهحل آماده دسترسی پیدا کرده باشند، کاملاً مردود تلقی شده و امتیاز صفر دریافت میکنند. کاگنیشن همچنین مواردی که مانع تأیید پچها میشدند را مورد ممیزی قرار داده است. هدف از این سختگیریها، اطمینان از این موضوع است که پچها واقعاً بر اساس نیازمندیهای پروژه تولید شوند و خبری از تقلب یا حفظ کردن پاسخها نباشد.
از آنجا که کاگنیشن خودش توسعهدهنده دوین است و بنچمارک FrontierCode را اداره میکند، این دادهها نتایج دستاول به شمار میآیند و باید دید در بررسیهای مستقل چه خروجی خواهند داشت. این بنچمارک دو بخش Main و Extended دارد و نتیجه ۶۰.۴ درصدی GPT-6.1 Sol مربوط به مسیر Extended است. برای مقایسهای مطمئن و منصفانه، باید تمام فاکتورها مانند بستر اجرا، ساختار ایجنت، تنظیمات استدلال و فرضیات هزینهای کاملاً یکسان باشند.
چرخههای مداوم ایجنتها و ضرورت مهار هزینهها
فرآیند کدنویسی خودکار ایجنتها معمولاً حجم عظیمی از توکنها را میبلعد؛ از فاز برنامهریزی و جستوجوی مخزن کد گرفته تا فراخوانی ابزارها، تلاشهای مجدد، اجرای تستها و ارزیابی خودکار خروجی. بنابراین کاهش ۴۴ تا ۵۷ درصدی هزینهها در کیفیتی کاملاً مشابه، هم هزینه انجام پروژههای متوالی را به شدت پایین میآورد و هم دست سیستم هدایت مدل (Model Router) را برای بهرهگیری از مدلهای پیشرو بازتر میگذارد.
البته میزان نهایی هزینهها در محیط عملیاتی و پروداکشن، به فاکتورهایی مثل پیچیدگی تسک، حجم کانتکست پروژه، تعداد تلاشهای مجدد، میزان مصرف ابزارها و مدل قیمتگذاری سرویس دوین بستگی خواهد داشت. از آنجا که اعداد اعلامشده هزینه خام استنتاج در محیط بنچمارک کاگنیشن را میسنجند، تیمهای توسعه باید ارقام واقعی را در پروژههای عملیاتی خود نیز تست و اعتبارسنجی کنند.
کاگنیشن پیش از این هم تمرکز ویژهای روی هدایت هوشمند مدلها بر اساس هزینه از طریق سیستم Devin Fusion داشته است. این شرکت سامانه Fusion را یک معماری چندمدلی مینامد که در عین کاهش ۶۰ درصدی هزینهها در مقایسه با مدلهای تراز اول، امتیاز ۶۸.۸ درصد را در بنچمارک ثبت کرده است. آنها همچنین از کاهش ۷۰ درصدی قیمت استفاده از دوین در حالتهای مختلف کدنویسی خبر دادهاند و حالا GPT-6.1 Sol گزینهای ارزانتر و در دسترستر برای این سیستم مسیریابی به حساب میآید.
اختلاف ۵ درصدی با پرچمداران؛ ارزش کدام بیشتر است؟
جدول ردهبندی بخش Extended نشان میدهد که مدل قدرتمند Opus 5.5 از آنتروپیک به امتیاز ۶۵.۳ درصد رسیده و با اختلاف ۴.۹ درصدی بالاتر از GPT-6.1 Sol (در حالت استدلال متوسط) ایستاده است. کاگنیشن اعلام کرده که اجرای مدلهای پرچمداری مثل Opus و Fable در بالاترین تنظیمات پردازشی، معمولاً بیش از ۱ دلار برای هر تسک هزینه برمیدارد؛ در حالی که اجرای GPT-6.1 Sol تنها بین ۲۱ تا ۳۱ سنت هزینه خواهد داشت.
این تفاوت قیمت، یک دوراهی شفاف و مهم پیش روی توسعهدهندگان میگذارد: مدلهای پرچمدار و گرانقیمت برای کارهای بسیار سخت و پیچیده که هر یک درصد کارایی در آنها سرنوشتساز است کاملاً مناسبند؛ اما در مقابل، مدل مقرونبهصرفهای مثل GPT-6.1 Sol برای پروژههای پرتعداد، کارهای روزمره و روتین مهندسی گزینهای فوقالعاده اقتصادی خواهد بود. نوع مخزن، تأخیر در پاسخدهی و زمان بررسی توسط برنامهنویسان انسانی میتواند خروجی اقتصادی کل پروژه را تغییر دهد.
رویکرد سنجیده برای مهاجرت به مدل جدید در دوین
در حال حاضر مدل GPT-6.1 Sol در برنامههای Devin Desktop و Devin CLI در دسترس قرار گرفته است. تیمهایی که میخواهند از GPT-6 Sol به این مدل تازه کوچ کنند، میتوانند کار را با تنظیمات استدلال پایین برای تسکهای روتین شروع کنند و حالت متوسط را برای پروژههایی که به برنامهریزی عمیقتر و تستهای جدی نیاز دارند به کار بگیرند.
- هر دو مدل را روی پروژهها و تسکهای مشابه در مخزن اختصاصی خود بسنجید.
- پرامپتها، دسترسی به ابزارها، آزمونهای پذیرش و بازههای زمانی را برای هر دو مدل یکسان نگه دارید.
- نرخ موفقیت تسکها، مجموع هزینه سشن، میزان تأخیر، دفعات تلاش مجدد و فراخوانی ابزارها را به دقت ثبت کنید.
- ویرایشهای انسانی، باگهای احتمالی ثانویه و اصلاحات پس از هر اجرا را زیر نظر بگیرید.
- تستهای خودکار و نظارت مهندسان انسانی را همچنان به عنوان شرط اصلی اعمال تغییرات در پروژههای نهایی حفظ کنید.
بر اساس شواهد موجود، مدل GPT-6.1 Sol با سطح استدلال پایین یک گزینه ایدهآل برای امور روزمره دوین است و سطح استدلال متوسط آن، امتیازی بالاتر را با هزینهای کاملاً منطقی به ارمغان میآورد. با این حال، تست عملی روی کدبیسهای واقعی نشان خواهد داد که این صرفهجویی تئوری تا چه اندازه با استانداردهای هر تیم کاری همخوانی دارد.
مطالب مرتبط و پیشنهادی

فرصت طلایی شهرهای کوچک در تب داغ هوش مصنوعی: دیتاسنترها سر کیسه را شل میکنند!
موج نارضایتی مردم از احداث دیتاسنترهای غولپیکر هوش مصنوعی رو به افزایش است، اما توافقهای جدید میتواند ورق را برگرداند و سود مالی چشمگیری نصیب ساکنان محلی کند. کارشناسان پیشنهاد میدهند غولهای فناوری به جای ساخت نیروگاه، هزینه تجهیز خانهها به پنل خورشیدی و باتری را تقبل کنند.

کجا باید ترمز هوش مصنوعی را بکشیم؟ درسهای حیاتی از دنیای جرمیابی دیجیتال
این روزها ردپای هوش مصنوعی در همه جا دیده میشود، اما در حوزه فوقالعاده حساسی مثل جرمیابی دیجیتال، اعتماد کورکورانه به خروجیهای آن میتواند فاجعهبار باشد. کارشناسان امنیتی تأکید میکنند که ابزارهای هوش مصنوعی درست مانند یک کارآموز یا تحلیلگر تازهکارِ بااستعداد هستند که کارها را سرعت میبخشند، اما تصمیم نهایی و قضاوت درباره گناهکاری یا بیگناهی افراد هرگز نباید از دست انسان خارج شود.

شکار طلای عصر هوش مصنوعی؛ ماجرای میلیاردی که با ساخت دیتاسنتر ثروتش ۴ برابر شد!
با اوجگیری جنون هوش مصنوعی و نیاز سیریناپذیر به پردازندههای گرافیکی، ساخت دیتاسنترهای چندمیلیارد دلاری به سودآورترین کسبوکار جهان تبدیل شده است. باب کلارک، غول ساختوساز آمریکا، با تبدیل زمینهای بایر به شهرهای هوش مصنوعی و مراکز پردازش کوانتومی، ثروتش را به ۷ میلیارد دلار رسانده و معتقد است هیچ ترمزی نمیتواند جلوی این انقلاب زیرساختی را بگیرد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.