پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ورود مدل GPT-6.1 Sol به دوین؛ کاهش ۵۷ درصدی هزینه‌های برنامه‌نویسی با هوش مصنوعی!

انتشار:۸ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

شرکت کاگنیشن مدل جدید GPT-6.1 Sol محصول اوپن‌ای‌آی را به مهندس نرم‌افزار هوشمند دوین اضافه کرد. این به‌روزرسانی بزرگ، ضمن حفظ دقت و کیفیت کدنویسی، هزینه‌های استنتاج را تا ۵۷ درصد کاهش می‌دهد و تحول چشمگیری در اقتصاد ایجنت‌های کدنویس ایجاد می‌کند.

ورود مدل GPT-6.1 Sol به دوین؛ کاهش ۵۷ درصدی هزینه‌های برنامه‌نویسی با هوش مصنوعی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل تازه‌نفس GPT-6.1 Sol به نسخه‌های دسکتاپ و خط فرمان ایجنت دوین (Devin) اضافه شد و عملکردی بسیار نزدیک به نسل قبلی خود به نمایش گذاشت.
  • با این مدل، هزینه اجرای تسک‌های برنامه‌نویسی بین ۴۴ تا ۵۷ درصد کاهش پیدا می‌کنه و در حالت تنظیمات متوسط، هزینه هر تسک به ۳۱ سنت می‌رسه.
  • این جهش قیمتی کارایی حلقه‌های خودکار برنامه‌نویسی رو دوچندان می‌کنه و انجام پروژه‌های حجیم و روتین کدنویسی رو فوق‌العاده مقرون‌به‌صرفه می‌سازه.

ورود مدل GPT-6.1 Sol به دوین؛ کارایی بالا با هزینه‌ای بهینه‌تر

شرکت کاگنیشن (Cognition) رسماً مدل GPT-6.1 Sol محصول اوپن‌ای‌آی (OpenAI) را به اپلیکیشن‌های دوین، از جمله نسخه دسکتاپ (Devin Desktop) و نسخه خط فرمان (Devin CLI)، اضافه کرد. طبق یادداشت‌های انتشار کاگنیشن، این مدل از نظر کیفیت و توان کدنویسی تقریباً دوشادوش نسل‌های پیشین خود حرکت می‌کند، اما هزینه استنتاج گزارش‌شده به ازای هر تسک بنچمارک را به شکلی چشمگیر کاهش می‌دهد.

امتیازهای برابر، اما با قیمتی به مراتب اقتصادی‌تر

در بنچمارک FrontierCode 1.1 Extended که متعلق به کاگنیشن است، مدل GPT-6.1 Sol در سطح استدلال متوسط (Medium) امتیاز ۶۰.۴ درصد را ثبت کرده است. برای مقایسه، مدل‌های GPT-6 Sol و GPT-5.6 Sol به ترتیب امتیازهای ۶۰.۷ و ۶۰.۶ درصد را به ثبت رسانده بودند. پارامتر تلاش استدلالی (Reasoning Effort) میزان منابع پردازشی که مدل برای برنامه‌ریزی، بررسی و اعتبارسنجی پاسخ صرف می‌کند را کنترل و تنظیم می‌کند.

مدل
سطح استدلال
امتیاز بنچمارک
هزینه هر تسک
GPT-6.1 Sol
متوسط (Medium)
۶۰.۴٪
۰.۳۱ دلار
GPT-6.1 Sol
پایین (Low)
۵۸.۱٪
۰.۲۱ دلار
GPT-6 Sol
حداکثر (Maximum)
۶۰.۷٪
۱.۶۶ دلار
GPT-6 Sol
پایین (Low)
۵۰.۵٪
نامشخص

کاگنیشن گزارش داده که مدل GPT-6.1 Sol در تنظیمات استدلالی هم‌سطح، بین ۴۴ تا ۵۷ درصد ارزان‌تر از GPT-6 Sol تمام می‌شود؛ در حالی که اختلاف امتیاز آنها در بنچمارک حتی به یک درصد هم نمی‌رسد. جالب‌تر اینکه مقایسه مستقیم GPT-6.1 Sol در سطح استدلال متوسط با GPT-6 Sol در حالت حداکثری، از افت شدید ۸۱ درصدی هزینه‌ها (از ۱.۶۶ دلار به ۳۱ سنت) خبر می‌دهد؛ هرچند این مقایسه با دو تنظیمات متغیر انجام شده است.

در سطح استدلال پایین نیز GPT-6.1 Sol نسبت به GPT-6 Sol رشد چشمگیر ۷.۶ درصدی را ثبت کرده است. کاگنیشن تأکید کرده که نتیجه ۵۸.۱ درصدی این مدل در حال حاضر بالا‌ترین امتیاز ثبت‌شده در بنچمارک FrontierCode در میان تمامی مدل‌هایی است که کم‌تر از ۳۰ سنت برای هر تسک خرج روی دست کاربر می‌گذارند.

معیار «قابل ادغام» (Mergeable) چیست و چطور سنجیده می‌شود؟

بنچمارک FrontierCode برای ارزیابی عملکرد مدل‌ها، از تسک‌های واقعی مهندسی نرم‌افزار که توسط نگهدارنده‌های پروژه‌های متن‌باز آماده شده‌اند، استفاده می‌کند. مجموعه‌ای هماهنگ از آزمون‌های واحد (Unit Tests)، اعتبارسنجی‌های معیاری و بررسی‌کننده‌های خودکار، کدهای تولیدشده را زیر ذره‌بین قرار می‌دهند و در صورتی که پچ نهایی شروط ادغام پروژه را پاس کند، تسک موفق اعلام می‌شود.

در ویرایش ۱.۱ این بنچمارک، اجرای تسک‌هایی که به منابع آنلاین حاوی راه‌حل آماده دسترسی پیدا کرده باشند، کاملاً مردود تلقی شده و امتیاز صفر دریافت می‌کنند. کاگنیشن همچنین مواردی که مانع تأیید پچ‌ها می‌شدند را مورد ممیزی قرار داده است. هدف از این سخت‌گیری‌ها، اطمینان از این موضوع است که پچ‌ها واقعاً بر اساس نیازمندی‌های پروژه تولید شوند و خبری از تقلب یا حفظ کردن پاسخ‌ها نباشد.

از آنجا که کاگنیشن خودش توسعه‌دهنده دوین است و بنچمارک FrontierCode را اداره می‌کند، این داده‌ها نتایج دست‌اول به شمار می‌آیند و باید دید در بررسی‌های مستقل چه خروجی خواهند داشت. این بنچمارک دو بخش Main و Extended دارد و نتیجه ۶۰.۴ درصدی GPT-6.1 Sol مربوط به مسیر Extended است. برای مقایسه‌ای مطمئن و منصفانه، باید تمام فاکتورها مانند بستر اجرا، ساختار ایجنت، تنظیمات استدلال و فرضیات هزینه‌ای کاملاً یکسان باشند.

چرخه‌های مداوم ایجنت‌ها و ضرورت مهار هزینه‌ها

فرآیند کدنویسی خودکار ایجنت‌ها معمولاً حجم عظیمی از توکن‌ها را می‌بلعد؛ از فاز برنامه‌ریزی و جست‌وجوی مخزن کد گرفته تا فراخوانی ابزارها، تلاش‌های مجدد، اجرای تست‌ها و ارزیابی خودکار خروجی. بنابراین کاهش ۴۴ تا ۵۷ درصدی هزینه‌ها در کیفیتی کاملاً مشابه، هم هزینه انجام پروژه‌های متوالی را به شدت پایین می‌آورد و هم دست سیستم هدایت مدل (Model Router) را برای بهره‌گیری از مدل‌های پیشرو بازتر می‌گذارد.

البته میزان نهایی هزینه‌ها در محیط عملیاتی و پروداکشن، به فاکتورهایی مثل پیچیدگی تسک، حجم کانتکست پروژه، تعداد تلاش‌های مجدد، میزان مصرف ابزار‌ها و مدل قیمت‌گذاری سرویس دوین بستگی خواهد داشت. از آنجا که اعداد اعلام‌شده هزینه خام استنتاج در محیط بنچمارک کاگنیشن را می‌سنجند، تیم‌های توسعه باید ارقام واقعی را در پروژه‌های عملیاتی خود نیز تست و اعتبارسنجی کنند.

کاگنیشن پیش از این هم تمرکز ویژه‌ای روی هدایت هوشمند مدل‌ها بر اساس هزینه از طریق سیستم Devin Fusion داشته است. این شرکت سامانه Fusion را یک معماری چندمدلی می‌نامد که در عین کاهش ۶۰ درصدی هزینه‌ها در مقایسه با مدل‌های تراز اول، امتیاز ۶۸.۸ درصد را در بنچمارک ثبت کرده است. آنها همچنین از کاهش ۷۰ درصدی قیمت استفاده از دوین در حالت‌های مختلف کدنویسی خبر داده‌اند و حالا GPT-6.1 Sol گزینه‌ای ارزان‌تر و در دسترس‌تر برای این سیستم مسیریابی به حساب می‌آید.

اختلاف ۵ درصدی با پرچمداران؛ ارزش کدام بیش‌تر است؟

جدول رده‌بندی بخش Extended نشان می‌دهد که مدل قدرتمند Opus 5.5 از آنتروپیک به امتیاز ۶۵.۳ درصد رسیده و با اختلاف ۴.۹ درصدی بالا‌تر از GPT-6.1 Sol (در حالت استدلال متوسط) ایستاده است. کاگنیشن اعلام کرده که اجرای مدل‌های پرچمداری مثل Opus و Fable در بالا‌ترین تنظیمات پردازشی، معمولاً بیش از ۱ دلار برای هر تسک هزینه برمی‌دارد؛ در حالی که اجرای GPT-6.1 Sol تنها بین ۲۱ تا ۳۱ سنت هزینه خواهد داشت.

این تفاوت قیمت، یک دوراهی شفاف و مهم پیش روی توسعه‌دهندگان می‌گذارد: مدل‌های پرچمدار و گران‌قیمت برای کار‌های بسیار سخت و پیچیده که هر یک درصد کارایی در آنها سرنوشت‌ساز است کاملاً مناسبند؛ اما در مقابل، مدل مقرون‌به‌صرفه‌ای مثل GPT-6.1 Sol برای پروژه‌های پرتعداد، کار‌های روزمره و روتین مهندسی گزینه‌ای فوق‌العاده اقتصادی خواهد بود. نوع مخزن، تأخیر در پاسخ‌دهی و زمان بررسی توسط برنامه‌نویسان انسانی می‌تواند خروجی اقتصادی کل پروژه را تغییر دهد.

رویکرد سنجیده برای مهاجرت به مدل جدید در دوین

در حال حاضر مدل GPT-6.1 Sol در برنامه‌های Devin Desktop و Devin CLI در دسترس قرار گرفته است. تیم‌هایی که می‌خواهند از GPT-6 Sol به این مدل تازه کوچ کنند، می‌توانند کار را با تنظیمات استدلال پایین برای تسک‌های روتین شروع کنند و حالت متوسط را برای پروژه‌هایی که به برنامه‌ریزی عمیق‌تر و تست‌های جدی نیاز دارند به کار بگیرند.

  • هر دو مدل را روی پروژه‌ها و تسک‌های مشابه در مخزن اختصاصی خود بسنجید.
  • پرامپت‌ها، دسترسی به ابزارها، آزمون‌های پذیرش و بازه‌های زمانی را برای هر دو مدل یکسان نگه دارید.
  • نرخ موفقیت تسک‌ها، مجموع هزینه سشن، میزان تأخیر، دفعات تلاش مجدد و فراخوانی ابزار‌ها را به دقت ثبت کنید.
  • ویرایش‌های انسانی، باگ‌های احتمالی ثانویه و اصلاحات پس از هر اجرا را زیر نظر بگیرید.
  • تست‌های خودکار و نظارت مهندسان انسانی را همچنان به عنوان شرط اصلی اعمال تغییرات در پروژه‌های نهایی حفظ کنید.

بر اساس شواهد موجود، مدل GPT-6.1 Sol با سطح استدلال پایین یک گزینه ایده‌آل برای امور روزمره دوین است و سطح استدلال متوسط آن، امتیازی بالا‌تر را با هزینه‌ای کاملاً منطقی به ارمغان می‌آورد. با این حال، تست عملی روی کدبیس‌های واقعی نشان خواهد داد که این صرفه‌جویی تئوری تا چه اندازه با استانداردهای هر تیم کاری همخوانی دارد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

فرصت طلایی شهرهای کوچک در تب داغ هوش مصنوعی: دیتاسنترها سر کیسه را شل می‌کنند!
آخرین اخبار

فرصت طلایی شهرهای کوچک در تب داغ هوش مصنوعی: دیتاسنترها سر کیسه را شل می‌کنند!

موج نارضایتی مردم از احداث دیتاسنترهای غول‌پیکر هوش مصنوعی رو به افزایش است، اما توافق‌های جدید می‌تواند ورق را برگرداند و سود مالی چشمگیری نصیب ساکنان محلی کند. کارشناسان پیشنهاد می‌دهند غول‌های فناوری به جای ساخت نیروگاه، هزینه تجهیز خانه‌ها به پنل خورشیدی و باتری را تقبل کنند.

۵ دقیقه مطالعه
۰
۸ مهر
کجا باید ترمز هوش مصنوعی را بکشیم؟ درس‌های حیاتی از دنیای جرم‌یابی دیجیتال
آخرین اخبار

کجا باید ترمز هوش مصنوعی را بکشیم؟ درس‌های حیاتی از دنیای جرم‌یابی دیجیتال

این روز‌ها ردپای هوش مصنوعی در همه جا دیده می‌شود، اما در حوزه فوق‌العاده حساسی مثل جرم‌یابی دیجیتال، اعتماد کورکورانه به خروجی‌های آن می‌تواند فاجعه‌بار باشد. کارشناسان امنیتی تأکید می‌کنند که ابزار‌های هوش مصنوعی درست مانند یک کارآموز یا تحلیل‌گر تازه‌کارِ بااستعداد هستند که کار‌ها را سرعت می‌بخشند، اما تصمیم نهایی و قضاوت درباره گناهکاری یا بی‌گناهی افراد هرگز نباید از دست انسان خارج شود.

۵ دقیقه مطالعه
۰
۸ مهر
شکار طلای عصر هوش مصنوعی؛ ماجرای میلیاردی که با ساخت دیتاسنتر ثروتش ۴ برابر شد!
آخرین اخبار

شکار طلای عصر هوش مصنوعی؛ ماجرای میلیاردی که با ساخت دیتاسنتر ثروتش ۴ برابر شد!

با اوج‌گیری جنون هوش مصنوعی و نیاز سیری‌ناپذیر به پردازنده‌های گرافیکی، ساخت دیتاسنترهای چندمیلیارد دلاری به سودآورترین کسب‌وکار جهان تبدیل شده است. باب کلارک، غول ساخت‌وساز آمریکا، با تبدیل زمین‌های بایر به شهرهای هوش مصنوعی و مراکز پردازش کوانتومی، ثروتش را به ۷ میلیارد دلار رسانده و معتقد است هیچ ترمزی نمی‌تواند جلوی این انقلاب زیرساختی را بگیرد.

۱۶ دقیقه مطالعه
۰
۸ مهر