پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی xAI از Grok 4.7 با اجرای طولانی‌تر ایجنت‌ها و بدون تغییر قیمت

انتشار:۳۱ شهریور ۱۴۰۵(۶ روز پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

شرکت xAI از مدل Grok 4.7 رونمایی کرد؛ یک به‌روزرسانی مبتنی بر یادگیری تقویتی برای Grok 4.6 که با همان قیمت و سرعت قبلی عرضه می‌شود. این مدل روی وظایف دشوارتر زمان بیشتری صرف می‌کند و توانایی خودآزمایی بهتری دارد.

رونمایی xAI از Grok 4.7 با اجرای طولانی‌تر ایجنت‌ها و بدون تغییر قیمت

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل Grok 4.7 با تمرکز بر اجرای طولانی‌تر ایجنت‌ها، استدلال عمیق‌تر و خودآزمایی قوی‌تر، با همان قیمت نسخه قبلی منتشر شد.
  • این به‌روزرسانی که نتیجه اعمال یادگیری تقویتی است، به مدل اجازه می‌دهد پیش از ارائه پاسخ نهایی، توکن‌های تفکر بیشتری را به پردازش‌های داخلی اختصاص دهد.
  • تیم‌های توسعه‌دهنده می‌توانند هم‌اکنون از طریق API رسمی xAI به این مدل دسترسی داشته باشند، هرچند افزایش طول استدلال ممکن است در نهایت به افزایش هزینه‌های مصرفی منجر شود.

هدف Grok 4.7 اجرای طولانی‌تر ایجنت‌ها با قیمت مشابه Grok 4.6 است

شرکت xAI سرانجام مدل Grok 4.7 را پس از چند بار تاخیر در زمان‌بندی عمومی، منتشر کرد. این شرکت مدل جدید را به عنوان جانشینی بی‌دردسر برای Grok 4.6 معرفی می‌کند که از استدلال طولانی‌تر در وظایف دشوار، خودآزمایی بیشتر و سازوکارهای ایمنی قوی‌تری برخوردار است. بر اساس اعلام xAI، مدل استاندارد همچنان قیمت و سرعت پاسخ‌دهی Grok 4.6 را حفظ کرده است.

برای تیم‌های توسعه‌دهنده، این انتشار امکان یک آزمایش ارتقای نسبتاً ارزان را فراهم می‌کند، زیرا ادغام‌های فعلی API احتمالاً به تغییرات محدودی در نرم‌افزارها نیاز خواهند داشت. با این حال، آزمایش بار کاری همچنان ضروری است: استدلال طولانی‌تر می‌تواند حجم خروجی، تاخیر و هزینه کل را حتی با ثابت ماندن نرخ هر توکن، افزایش دهد.

نگاهی خلاصه به ویژگی‌های نسخه جدید

مورد
جزئیات Grok 4.7
دسترسی اولیه
API رسمی xAI، نرم‌افزار Cursor و پلتفرم Grok Build
قیمت استاندارد
۲ دلار به ازای هر میلیون توکن ورودی و ۶ دلار به ازای هر میلیون توکن خروجی
سرویس سریع‌تر
۴ دلار به ازای هر میلیون توکن ورودی و ۱۲ دلار به ازای هر میلیون توکن خروجی
تغییرات اصلی
استدلال طولانی‌تر، خودآزمایی قوی‌تر و بازنگری در مدیریت وظایف
شواهد منتشرشده
یک دموی مقایسه‌ای از ساخت یک بازی توسط xAI؛ هنوز نتایج مستقلی منتشر نشده است
معماری
تعداد پارامترها و تغییرات مدل پایه همچنان نامشخص است

نقش یادگیری تقویتی در توسعه این نسخه

شرکت xAI تاخیر در انتشار را به کارهای مرتبط با یادگیری تقویتی که پس از اجرای اصلی آموزش مدل انجام شده است، نسبت می‌دهد. این مرحله با استفاده از سیگنال‌های پاداش، رفتار مدل را تنظیم می‌کند، از جمله اینکه مدل تا چه زمانی روی یک وظیفه کار کند، چه زمانی از ابزارها بهره ببرد و چه زمانی تصمیم بگیرد که کار به پایان رسیده است.

در طول دوره تاخیر، ایلان ماسک اشاره کرده بود که نسخه‌های داخلی گاهی اوقات وظایف دشوار را خیلی زود متوقف می‌کردند و در تایید نتایج خود ناکام می‌ماندند. او همچنین به مشکلاتی در زمینه جریمه‌های مربوط به طول پاسخ و مدیریت وظایف اشاره کرد. طبق گفته xAI، مدل منتشرشده توکن‌های تفکر (Thinking Tokens) بیشتری را به خود اختصاص می‌دهد؛ به این معنا که وقتی یک درخواست نیاز به استدلال گسترده دارد، محاسبات داخلی پیش از ارائه پاسخ نهایی افزایش می‌یابد.

جزئیات معماری هنوز مشخص نیست زیرا xAI اطلاعاتی در مورد تعداد پارامترهای Grok 4.7، میزان محاسبات آموزشی یا طراحی مدل پایه منتشر نکرده است. گزارش‌هایی مبنی بر وجود یک مدل ۲.۱ تریلیون پارامتری هنوز تایید نشده‌اند و نباید مبنای تصمیم‌گیری برای زیرساخت یا ظرفیت قرار گیرند.

شروع دسترسی‌ها از طریق xAI، Cursor و Grok Build

در زمان راه‌اندازی، توسعه‌دهندگان می‌توانند از طریق API رسمی xAI، نرم‌افزار Cursor و پلتفرم Grok Build از Grok 4.7 استفاده کنند. برنامه‌های فعلی مبتنی بر Grok 4.6 ممکن است تنها به تغییر انتخابگر مدل نیاز داشته باشند، هرچند تیم‌ها باید شناسه دقیق مدل، سازگاری نقطه پایانی (Endpoint) و رفتار نام‌های مستعار را در مستندات فعلی API شرکت xAI بررسی کنند.

پلتفرم‌های OpenRouter، Vercel و Cloudflare مدل Grok 4.6 را از طریق کانال‌های شرکا توزیع می‌کردند. پشتیبانی آن‌ها از Grok 4.7 تا زمانی که هر ارائه‌دهنده اطلاعات مربوط به مدل، قیمت‌گذاری، محدودیت‌های کانتکست و در دسترس بودن منطقه‌ای را مشخص نکند، در حالت تعلیق باقی می‌ماند.

آغاز شواهد با یک دموی بازی‌سازی

شرکت xAI یک دموی مقایسه‌ای منتشر کرده است که در آن Grok 4.7 و Grok 4.6 هر دو یک بازی جهان‌باز شهری را در یک بازه زمانی یکسان می‌سازند. بر اساس ارائه این شرکت، مدل جدیدتر صحنه‌ای کامل‌تر تولید می‌کند. با این حال، همچنان به ارزیابی‌های مستقل نیاز است تا قابلیت اطمینان آن در مخازن کد، فریم‌ورک‌ها و پیکربندی ابزارها اثبات شود.

ارزیابی‌های اخیر xAI بر مجموعه‌هایی مانند DeepSWE، CursorBench، Terminal-Bench، APEX و AA-Briefcase متمرکز بوده‌اند. این مجموعه‌ها بر کارهای مبتنی بر ایجنت تمرکز دارند، جایی که یک مدل چندین مرحله را برنامه‌ریزی می‌کند، فایل‌ها را ویرایش می‌کند، ابزارها را اجرا می‌کند و به شکست‌ها واکنش نشان می‌دهد. مطالب منتشرشده کنونی هیچ نمره قابل مقایسه‌ای برای Grok 4.7 یا روش‌شناسی دقیق ارزیابی ارائه نمی‌دهند.

بارهای کاری که با تغییرات اعلام‌شده همخوانی دارند عبارتند از:

  • وظایف برنامه‌نویسی طولانی در سطح مخزن که به ویرایش‌ها و آزمایش‌های مکرر نیاز دارند
  • استفاده چندمرحله‌ای از ابزارها که در آن مدل باید قبل از ادامه کار نتایج را بررسی کند
  • کارهای مرتبط با رابط کاربری مولد که چندین فایل هماهنگ را در بر می‌گیرند
  • تولید بازی و صحنه‌های سه‌بعدی با دارایی‌ها و اجزای وابسته متعدد
  • حلقه‌های ایجنت که پیش از این قبل از برآورده شدن تمام معیارهای پذیرش به پایان می‌رسیدند

درخواست‌های کوتاه برای طبقه‌بندی، استخراج، مسیریابی و چت ممکن است پیشرفت‌های کمتری را نشان دهند، زیرا فضای کمی برای استدلال گسترده یا استفاده مکرر از ابزارها فراهم می‌کنند.

پاسخ‌های طولانی‌تر می‌تواند هزینه‌ها را تغییر دهد

هنگامی که Grok 4.7 خروجی بیشتری تولید می‌کند یا روی درخواست‌هایی که Grok 4.6 به سرعت انجام می‌داد استدلال طولانی‌تری انجام می‌دهد، هزینه کل ممکن است افزایش یابد. تیم‌ها باید به جای مقایسه صرف نرخ توکن‌ها، هزینه را به ازای هر وظیفه تکمیل‌شده، از جمله تلاش‌های مجدد و فراخوانی‌های ناموفق ابزارها اندازه‌گیری کنند.

تاخیر در پاسخ‌گویی به درخواست‌ها نیز نیازمند آزمایش محلی است. ادعای xAI مبنی بر سرعت بدون تغییر ممکن است به توان عملیاتی سرویس‌دهی یا یک هدف کلی برای تاخیر اشاره داشته باشد، در حالی که پردازش درخواست‌های سخت به صورت فردی ممکن است همچنان طولانی‌تر شود، زیرا مدل استدلال بیشتری انجام می‌دهد. معیارهایی مانند تاخیر میانه، تاخیر در موارد حاشیه‌ای (Tail Latency)، زمان دریافت اولین توکن و زمان کل تکمیل، دید بهتری برای محیط تولید فراهم می‌کنند.

ادعاهای ایمنی به مستندات نیاز دارند

شرکت xAI مدل Grok 4.7 را به عنوان ایمن‌ترین مدل خود تا به امروز توصیف می‌کند، اما خلاصه منتشرشده کارت سیستم کاملی را ارائه نمی‌دهد. کارت سیستم معمولاً ارزیابی‌های ایمنی، حالت‌های شکست شناخته‌شده، راهکارهای کاهش خطرات و محدودیت‌های استقرار را مستند می‌کند و به تیم‌های امنیتی و حاکمیتی شواهدی برای بررسی می‌دهد.

ارزیابی‌های سازمانی باید مقاومت در برابر تزریق پرامپت (Prompt Injection)، مدیریت داده‌های حساس، مجوزهای ابزارها، رفتار امتناع از پاسخ، مرزهای اجرای کد و کنترل‌های ثبت وقایع را بررسی کنند. آزمایش‌های خارجی نیز برای مقایسه سازوکارهای ایمنی این مدل با نسخه‌های قبلی Grok ضروری خواهد بود.

جزئیات کلیدی API همچنان مبهم است

خلاصه منتشرشده چندین سوال را در مورد پیاده‌سازی برای xAI و شرکای توزیع‌کننده آن بی‌پاسخ می‌گذارد:

سوال بی‌پاسخ
چرا توسعه‌دهندگان به آن نیاز دارند
شناسه مدل‌ها و رفتار نام مستعار
ثابت نگه داشتن نسخه، تکرارپذیری و قابلیت بازگشت به نسخه قبل
محدودیت‌های کانتکست و خروجی
قطعه‌بندی داده‌ها، مدیریت برش متن و طراحی حافظه
سازگاری ابزارها و ساختار (Schema)
قابلیت اطمینان ایجنت و اعتبارسنجی خروجی‌های ساختاریافته
محاسبه توکن‌های تفکر
تخمین دقیق تاخیر و هزینه‌ها
نرخ‌های کش (Caching) و پردازش دسته‌ای
صرفه‌جویی اقتصادی برای پرامپت‌های تکراری و وظایف آفلاین
محدودیت‌های نرخ (Rate Limits) و مناطق
برنامه‌ریزی ظرفیت و انطباق با قوانین استقرار
برنامه توقف پشتیبانی از Grok 4.6
برنامه‌ریزی برای جایگزینی و زمان‌بندی مهاجرت به نسخه جدید

انتشارهای سریع ارزش نسخه‌بندی را بالا می‌برد

مدل Grok 4.7 تقریباً در فاصله دو ماه پس از Grok 4.5 و Grok 4.6 منتشر شده است. این سرعت عمل به xAI اجازه می‌دهد تا بهبودهای پس از آموزش را به سرعت ارائه دهد، اما در عین حال زمان کمتری برای ارزیابی هر نسخه پیش از رسیدن نسخه بعدی به توسعه‌دهندگان می‌دهد.

به‌روزرسانی‌های سریع و تاخیر در زمان‌بندی‌های عمومی، ارزش نسخه‌های ثابت مدل، مجموعه‌های آزمایش رگرسیون و حفظ مسیرهای بازگشت به نسخه‌های قبلی را افزایش می‌دهد. ثابت ماندن نرخ توکن‌ها جایگاه رقابتی قیمت xAI را حفظ می‌کند، اما ارزش آن در محیط تولید به تعداد وظایف موفق به ازای هر دلار و ثبات عملیاتی هر نسخه بستگی دارد.

معیارهای آزمایشی (Canary) برای مهاجرت

یک استقرار آزمایشی کنترل‌شده می‌تواند پیش از دریافت ترافیک عمومی، مشخص کند که آیا Grok 4.7 یک بار کاری خاص را بهبود می‌بخشد یا خیر. این مقایسه باید از پرامپت‌های تولیدی نماینده و معیارهای پذیرش ثابت استفاده کند.

  1. شناسه‌های مدل، محدودیت‌های کانتکست، پشتیبانی از ابزارها، محدودیت‌های نرخ و شرایط حفظ داده‌ها را تایید کنید.
  2. یک مجموعه ارزیابی تولیدی را هم روی Grok 4.6 و هم Grok 4.7 اجرا کنید.
  3. تکمیل وظایف، توکن‌های خروجی، تلاش‌های مجدد، دقت فراخوانی ابزارها، انطباق با ساختار و درصدهای تاخیر را اندازه‌گیری کنید.
  4. پاسخ‌های طولانی‌تر را برای بررسی خروجی‌های غیرضروری، برش متن و افزایش هزینه‌ها بازبینی کنید.
  5. سیاست‌های ایمنی و مرزهای مجوز را برای هر ابزار متصل آزمایش کنید.
  6. تا زمانی که نسخه آزمایشی به آستانه‌های مورد نظر نرسیده است، Grok 4.6 را به عنوان هدف بازگشت در دسترس نگه دارید.

تیم‌هایی که در حال حاضر از Grok 4.6 استفاده می‌کنند، واضح‌ترین مسیر را برای مهاجرت دارند. ارتقا به نسخه جدید باید پس از مشاهده دستاوردهای قابل اندازه‌گیری در کیفیت تکمیل وظایف یا کاهش هزینه به ازای هر وظیفه موفق، همراه با رفتار پایدار API و مسیر آزمایش‌شده برای بازگشت به نسخه قبل، انجام شود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر