پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

اضافه شدن مدل Grok 4.7 به دستیار برنامه‌نویسی Devin؛ هشدار درباره تغییرات گسترده و ناخواسته کدها

انتشار:۳۱ شهریور ۱۴۰۵(۵ روز پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

شرکت Cognition پشتیبانی از مدل هوش مصنوعی Grok 4.7 را به نسخه‌های دسکتاپ و خط فرمان Devin اضافه کرد و اکنون در دسترس تمام کاربران قرار دارد.

اضافه شدن مدل Grok 4.7 به دستیار برنامه‌نویسی Devin؛ هشدار درباره تغییرات گسترده و ناخواسته کدها

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • شرکت Cognition پشتیبانی از مدل ۲.۱ تریلیون پارامتری Grok 4.7 متعلق به xAI را به برنامه‌های دسکتاپ و خط فرمان Devin اضافه کرد.
  • این مدل در تسک‌های پیچیده بک‌اند (زبان‌های Java، Go و Ruby) عملکرد بسیار خوبی دارد و کدهای وابستگی‌ها را به دقت بررسی می‌کند.
  • نقطه ضعف Grok 4.7 تمایل آن به گسترش دامنه کار و ویرایش غیرضروری کدهای مجاور است که زمان بازبینی و خطر بروز باگ را افزایش می‌دهد.

ورود Grok 4.7 به Devin همراه با چالش‌های کنترل دامنه تغییرات

بر اساس اعلام شرکت Cognition، مدل Grok 4.7 متعلق به xAI اکنون به برنامه‌های Devin Desktop و Devin CLI اضافه شده است. در هفته منتهی به ۲۱ سپتامبر ۲۰۲۶، این مدل برای GitHub Copilot و Cursor نیز منتشر شده بود.

بررسی‌های داخلی Cognition نشان می‌دهد که چرا توسعه‌دهندگان باید در انتخاب این مدل دقت کنند. Grok 4.7 در کارهای پیچیده بک‌اند که به کاوش گسترده در پایگاه کد و تست‌های یکپارچه‌سازی نیاز دارند، عملکرد خوبی از خود نشان داده است، اما تمایل آن به تغییر کدهای مجاور باعث کاهش امتیاز کلی آن می‌شود.

بررسی عمیق‌تر، تغییرات گسترده‌تر

شرکت Cognition عملکرد Grok 4.7 را در بنچمارک اختصاصی خود یعنی FrontierCode 1.1 ارزیابی کرده است که بر اساس درخواست‌های ادغام (Pull Requests) مخازن منبع‌باز ساخته شده است. این بنچمارک میزان صحت و قابلیت ادغام را می‌سنجد؛ به این معنا که آیا یک بازبین‌کننده کد به طور منطقی می‌تواند تغییر ایجاد شده را بپذیرد یا خیر.

مدل Grok 4.7 در بخش Extended این بنچمارک امتیاز ۵۹.۴ درصد را کسب کرد. ارزیابی‌ها نشان داد که قوی‌ترین نتایج این مدل در تسک‌های پیچیده و چندماژوله زبان‌های Java، Go و Ruby به دست آمده است. این مدل غالباً کدهای منبع وابستگی‌ها را بررسی می‌کند، رفتار را در ماژول‌های مختلف ردیابی می‌کند و تغییرات را با تست‌های یکپارچه‌سازی اعتبارسنجی می‌کند.

با این حال، این بررسی‌های گسترده منجر به ویرایش‌های غیرضروری نیز می‌شود. بر اساس گزارش Cognition، مدل Grok 4.7 در مجموع با اختلاف اندکی پایین‌تر از Grok 4.6 قرار گرفت، زیرا این مدل دامنه تسک‌ها را گسترش داده و کدهای بیشتری را تغییر می‌دهد (Diff بزرگتر). به عنوان مثال، یک اصلاح باگ هدفمند ممکن است شامل بازنویسی کدهای (Refactoring) ناخواسته در ماژول‌های همسایه شود که زمان بازبینی و خطر رگرسیون را افزایش می‌دهد.

بنچمارکی شبیه به بازبینی کد

بنچمارک FrontierCode کدها را بر اساس معیارهای تعیین‌شده توسط بازبین‌کننده ارزیابی می‌کند. برخی از معیارها به عنوان موانع حیاتی (Blockers) تعیین شده‌اند و در صورت عدم رعایت آن‌ها، سقف امتیاز آن اجرا محدود می‌شود، درست مانند یک تغییر الزامی در فرآیند بازبینی کد واقعی.

برای نسخه ۱.۱، شرکت Cognition بیش از ۱۰۰۰ معیار مسدودکننده را بررسی کرده و ۷۵ مورد را که بیش از حد سخت‌گیرانه بودند، دسته‌بندی مجدد کرد. این بازبینی مواردی را که در آن یک مشکل جزئی جریمه‌ای برابر با یک نقص بزرگ (که مانع ادغام کد می‌شود) در پی داشت، کاهش می‌دهد.

این بنچمارک اجازه دسترسی به اینترنت را برای خواندن مستندات و سایر تحقیقات مجاز می‌دهد. یک طبقه‌بند مبتنی بر پرامپت و یک تاییدکننده برنامه‌نویسی‌شده بررسی می‌کنند که آیا ایجنت به درخواست ادغام اصلی حاوی پاسخ دسترسی پیدا کرده است یا خیر. اجراهایی که راه‌حل اصلی را واکشی می‌کنند، امتیاز صفر می‌گیرند.

از آنجایی که FrontierCode یک بنچمارک اختصاصی است، نتیجه ۵۹.۴ درصدی آن باید بیشتر به عنوان اندازه‌گیری Cognition در نظر گرفته شود تا یک نمره استاندارد صنعتی قابل تکرار. با این حال، طراحی مبتنی بر بازبینی آن شواهد مفیدی در مورد کیفیت تغییرات، دامنه کار و آمادگی برای ادغام ارائه می‌دهد.

یک مدل پایه بزرگ‌تر با هزینه توکن کمتر

مدل Grok 4.7 از یک مدل پایه جدید با ۲.۱ تریلیون پارامتر استفاده می‌کند که ۴۰ درصد نسبت به ۱.۵ تریلیون پارامتر Grok 4.6 افزایش یافته است. پارامترها وزن‌های آموخته‌شده درون یک مدل هستند و تعداد آن‌ها به تنهایی عملکرد کدنویسی را پیش‌بینی نمی‌کند.

به گفته xAI، این شرکت از زمان‌بندی طولانی‌تر برای یادگیری تقویتی و مجموعه سخت‌تری از مسائل آموزشی چندساعته استفاده کرده است. این شرکت همچنین سوابق مهندسی داخلی SpaceX را با هدف تقویت استدلال در مورد سخت‌افزار و سیستم‌های فیزیکی در داده‌های آموزشی گنجانده است.

هزینه استفاده از Grok 4.7 برابر با ۲ دلار به ازای هر میلیون توکن ورودی و ۶ دلار به ازای هر میلیون توکن خروجی است. یک اجرا که یک میلیون توکن ورودی و ۱۰۰ هزار توکن خروجی مصرف کند، با این نرخ‌ها ۲.۶۰ دلار هزینه خواهد داشت. Devin بر اساس صورت‌حساب مبتنی بر مصرف، هزینه‌های اعلام‌شده ارائه‌دهنده را دریافت می‌کند.

نتایج متفاوت خارج از محیط Devin

نتایج به دست آمده از لیدربوردهای گسترده‌تر نشان می‌دهد که عملکرد Grok 4.7 به شدت به فرمت تسک‌ها بستگی دارد. هر بنچمارک از یک مجموعه داده و سیستم امتیازدهی متفاوت استفاده می‌کند، بنابراین اعداد خام آن‌ها مستقیماً قابل مقایسه نیستند.

بنچمارک
Grok 4.7
مقایسه
Artificial Analysis Intelligence Index v4.3.2
۴۶
مدل‌های Claude Fable 5.1 و GPT-6 امتیاز ۵۳ کسب کردند
Terminal-Bench 4.0
۲۶٪
مدل GPT-6 Astra امتیاز ۶۰٪؛ Claude Fable 5.1 امتیاز ۵۵٪
AA-Briefcase
۱۶۵۷ Elo
۱۱۱ امتیاز افزایش نسبت به Grok 4.6 اما پایین‌تر از Claude Fable 5.1
GDPval
۱۶۹۵ Elo
پایین‌تر از Claude Fable 5.1

نتایج ترکیبی نشان می‌دهد که Grok 4.7 برای کارهای ساختاریافته بک‌اند و بررسی‌های طولانی‌مدت مناسب‌تر است. امتیاز ضعیف‌تر در Terminal-Bench و جریمه‌های مربوط به گسترش دامنه تغییرات در FrontierCode نشانگر عملکرد نه‌چندان پایدار در تسک‌های خط فرمان و تغییرات بسیار محدود است.

بهترین انتخاب برای کارهای عمیق بک‌اند

یافته‌های Cognition نشان می‌دهد که استفاده از Grok 4.7 برای تسک‌هایی با ویژگی‌های زیر مناسب است:

  • بک‌اند‌های بزرگ مبتنی بر Java، Go یا Ruby که رفتار سیستم در چندین ماژول پخش شده است.
  • مشکلاتی که نیازمند بررسی کدهای منبع فریم‌ورک یا وابستگی‌ها هستند.
  • تغییراتی که نیاز به تست‌های یکپارچه‌سازی در سرویس‌ها یا کامپوننت‌های فعال دارند.
  • بررسی‌های طولانی که بازبین‌کنندگان می‌توانند حجم بیشتری از تغییرات کد (Diff) را مدیریت کنند.

مدل Grok 4.6 ممکن است همچنان انتخاب بهتری برای پچ‌های کوچک و کاملاً مشخص، یا اجراهای موازی ایجنت‌ها باشد؛ جایی که تغییرات اضافی در فایل‌ها باعث افزایش مصرف توکن و زمان بازبینی می‌شود. تیم‌هایی که از Grok 4.7 استفاده می‌کنند باید محدودیت‌های دقیق دامنه کار را مشخص کرده و کدهای نهایی را برای جلوگیری از ویرایش‌های نامرتبط بازبینی کنند.

توسعه‌دهندگان می‌توانند با دانلود Devin Desktop یا نصب Devin CLI و سپس انتخاب Grok 4.7 از منوی انتخاب مدل، به آن دسترسی پیدا کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر