اضافه شدن مدل Grok 4.7 به دستیار برنامهنویسی Devin؛ هشدار درباره تغییرات گسترده و ناخواسته کدها
شرکت Cognition پشتیبانی از مدل هوش مصنوعی Grok 4.7 را به نسخههای دسکتاپ و خط فرمان Devin اضافه کرد و اکنون در دسترس تمام کاربران قرار دارد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- شرکت Cognition پشتیبانی از مدل ۲.۱ تریلیون پارامتری Grok 4.7 متعلق به xAI را به برنامههای دسکتاپ و خط فرمان Devin اضافه کرد.
- این مدل در تسکهای پیچیده بکاند (زبانهای Java، Go و Ruby) عملکرد بسیار خوبی دارد و کدهای وابستگیها را به دقت بررسی میکند.
- نقطه ضعف Grok 4.7 تمایل آن به گسترش دامنه کار و ویرایش غیرضروری کدهای مجاور است که زمان بازبینی و خطر بروز باگ را افزایش میدهد.
ورود Grok 4.7 به Devin همراه با چالشهای کنترل دامنه تغییرات
بر اساس اعلام شرکت Cognition، مدل Grok 4.7 متعلق به xAI اکنون به برنامههای Devin Desktop و Devin CLI اضافه شده است. در هفته منتهی به ۲۱ سپتامبر ۲۰۲۶، این مدل برای GitHub Copilot و Cursor نیز منتشر شده بود.
بررسیهای داخلی Cognition نشان میدهد که چرا توسعهدهندگان باید در انتخاب این مدل دقت کنند. Grok 4.7 در کارهای پیچیده بکاند که به کاوش گسترده در پایگاه کد و تستهای یکپارچهسازی نیاز دارند، عملکرد خوبی از خود نشان داده است، اما تمایل آن به تغییر کدهای مجاور باعث کاهش امتیاز کلی آن میشود.
بررسی عمیقتر، تغییرات گستردهتر
شرکت Cognition عملکرد Grok 4.7 را در بنچمارک اختصاصی خود یعنی FrontierCode 1.1 ارزیابی کرده است که بر اساس درخواستهای ادغام (Pull Requests) مخازن منبعباز ساخته شده است. این بنچمارک میزان صحت و قابلیت ادغام را میسنجد؛ به این معنا که آیا یک بازبینکننده کد به طور منطقی میتواند تغییر ایجاد شده را بپذیرد یا خیر.
مدل Grok 4.7 در بخش Extended این بنچمارک امتیاز ۵۹.۴ درصد را کسب کرد. ارزیابیها نشان داد که قویترین نتایج این مدل در تسکهای پیچیده و چندماژوله زبانهای Java، Go و Ruby به دست آمده است. این مدل غالباً کدهای منبع وابستگیها را بررسی میکند، رفتار را در ماژولهای مختلف ردیابی میکند و تغییرات را با تستهای یکپارچهسازی اعتبارسنجی میکند.
با این حال، این بررسیهای گسترده منجر به ویرایشهای غیرضروری نیز میشود. بر اساس گزارش Cognition، مدل Grok 4.7 در مجموع با اختلاف اندکی پایینتر از Grok 4.6 قرار گرفت، زیرا این مدل دامنه تسکها را گسترش داده و کدهای بیشتری را تغییر میدهد (Diff بزرگتر). به عنوان مثال، یک اصلاح باگ هدفمند ممکن است شامل بازنویسی کدهای (Refactoring) ناخواسته در ماژولهای همسایه شود که زمان بازبینی و خطر رگرسیون را افزایش میدهد.
بنچمارکی شبیه به بازبینی کد
بنچمارک FrontierCode کدها را بر اساس معیارهای تعیینشده توسط بازبینکننده ارزیابی میکند. برخی از معیارها به عنوان موانع حیاتی (Blockers) تعیین شدهاند و در صورت عدم رعایت آنها، سقف امتیاز آن اجرا محدود میشود، درست مانند یک تغییر الزامی در فرآیند بازبینی کد واقعی.
برای نسخه ۱.۱، شرکت Cognition بیش از ۱۰۰۰ معیار مسدودکننده را بررسی کرده و ۷۵ مورد را که بیش از حد سختگیرانه بودند، دستهبندی مجدد کرد. این بازبینی مواردی را که در آن یک مشکل جزئی جریمهای برابر با یک نقص بزرگ (که مانع ادغام کد میشود) در پی داشت، کاهش میدهد.
این بنچمارک اجازه دسترسی به اینترنت را برای خواندن مستندات و سایر تحقیقات مجاز میدهد. یک طبقهبند مبتنی بر پرامپت و یک تاییدکننده برنامهنویسیشده بررسی میکنند که آیا ایجنت به درخواست ادغام اصلی حاوی پاسخ دسترسی پیدا کرده است یا خیر. اجراهایی که راهحل اصلی را واکشی میکنند، امتیاز صفر میگیرند.
از آنجایی که FrontierCode یک بنچمارک اختصاصی است، نتیجه ۵۹.۴ درصدی آن باید بیشتر به عنوان اندازهگیری Cognition در نظر گرفته شود تا یک نمره استاندارد صنعتی قابل تکرار. با این حال، طراحی مبتنی بر بازبینی آن شواهد مفیدی در مورد کیفیت تغییرات، دامنه کار و آمادگی برای ادغام ارائه میدهد.
یک مدل پایه بزرگتر با هزینه توکن کمتر
مدل Grok 4.7 از یک مدل پایه جدید با ۲.۱ تریلیون پارامتر استفاده میکند که ۴۰ درصد نسبت به ۱.۵ تریلیون پارامتر Grok 4.6 افزایش یافته است. پارامترها وزنهای آموختهشده درون یک مدل هستند و تعداد آنها به تنهایی عملکرد کدنویسی را پیشبینی نمیکند.
به گفته xAI، این شرکت از زمانبندی طولانیتر برای یادگیری تقویتی و مجموعه سختتری از مسائل آموزشی چندساعته استفاده کرده است. این شرکت همچنین سوابق مهندسی داخلی SpaceX را با هدف تقویت استدلال در مورد سختافزار و سیستمهای فیزیکی در دادههای آموزشی گنجانده است.
هزینه استفاده از Grok 4.7 برابر با ۲ دلار به ازای هر میلیون توکن ورودی و ۶ دلار به ازای هر میلیون توکن خروجی است. یک اجرا که یک میلیون توکن ورودی و ۱۰۰ هزار توکن خروجی مصرف کند، با این نرخها ۲.۶۰ دلار هزینه خواهد داشت. Devin بر اساس صورتحساب مبتنی بر مصرف، هزینههای اعلامشده ارائهدهنده را دریافت میکند.
نتایج متفاوت خارج از محیط Devin
نتایج به دست آمده از لیدربوردهای گستردهتر نشان میدهد که عملکرد Grok 4.7 به شدت به فرمت تسکها بستگی دارد. هر بنچمارک از یک مجموعه داده و سیستم امتیازدهی متفاوت استفاده میکند، بنابراین اعداد خام آنها مستقیماً قابل مقایسه نیستند.
بنچمارک | Grok 4.7 | مقایسه |
|---|---|---|
Artificial Analysis Intelligence Index v4.3.2 | ۴۶ | مدلهای Claude Fable 5.1 و GPT-6 امتیاز ۵۳ کسب کردند |
Terminal-Bench 4.0 | ۲۶٪ | مدل GPT-6 Astra امتیاز ۶۰٪؛ Claude Fable 5.1 امتیاز ۵۵٪ |
AA-Briefcase | ۱۶۵۷ Elo | ۱۱۱ امتیاز افزایش نسبت به Grok 4.6 اما پایینتر از Claude Fable 5.1 |
GDPval | ۱۶۹۵ Elo | پایینتر از Claude Fable 5.1 |
نتایج ترکیبی نشان میدهد که Grok 4.7 برای کارهای ساختاریافته بکاند و بررسیهای طولانیمدت مناسبتر است. امتیاز ضعیفتر در Terminal-Bench و جریمههای مربوط به گسترش دامنه تغییرات در FrontierCode نشانگر عملکرد نهچندان پایدار در تسکهای خط فرمان و تغییرات بسیار محدود است.
بهترین انتخاب برای کارهای عمیق بکاند
یافتههای Cognition نشان میدهد که استفاده از Grok 4.7 برای تسکهایی با ویژگیهای زیر مناسب است:
- بکاندهای بزرگ مبتنی بر Java، Go یا Ruby که رفتار سیستم در چندین ماژول پخش شده است.
- مشکلاتی که نیازمند بررسی کدهای منبع فریمورک یا وابستگیها هستند.
- تغییراتی که نیاز به تستهای یکپارچهسازی در سرویسها یا کامپوننتهای فعال دارند.
- بررسیهای طولانی که بازبینکنندگان میتوانند حجم بیشتری از تغییرات کد (Diff) را مدیریت کنند.
مدل Grok 4.6 ممکن است همچنان انتخاب بهتری برای پچهای کوچک و کاملاً مشخص، یا اجراهای موازی ایجنتها باشد؛ جایی که تغییرات اضافی در فایلها باعث افزایش مصرف توکن و زمان بازبینی میشود. تیمهایی که از Grok 4.7 استفاده میکنند باید محدودیتهای دقیق دامنه کار را مشخص کرده و کدهای نهایی را برای جلوگیری از ویرایشهای نامرتبط بازبینی کنند.
توسعهدهندگان میتوانند با دانلود Devin Desktop یا نصب Devin CLI و سپس انتخاب Grok 4.7 از منوی انتخاب مدل، به آن دسترسی پیدا کنند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.