کیت توسعه Antigravity شرکت Google اجرای آفلاین ایجنتهای هوش مصنوعی را ممکن کرد
کیت توسعه نرمافزار Antigravity شرکت Google اکنون از اجرای محلی مدلها پشتیبانی میکند و به توسعهدهندگان اجازه میدهد جریانهای کاری ایجنتهای هوش مصنوعی را بدون نیاز به پردازش ابری اجرا کنند. این قابلیت با بهرهگیری از مدل Gemma 4 26B و موتور LiteRT، علاوه بر حفظ حریم خصوصی کدها، هزینههای سرسامآور فراخوانی API را بهطور کامل حذف میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- پشتیبانی رسمی Google Antigravity SDK از اجرای محلی جریانهای کاری ایجنتها با مدل پیشفرض Gemma 4 26B و رانتایم LiteRT
- امکان اتصال به سرورهای سازگار با OpenAI نظیر Ollama و vLLM بدون نیاز به بازنویسی ابزارها و منطق ایجنت
- معرفی معماری «معمار-سازنده» برای واگذاری برنامهریزی به مدل ابری و پردازش کدها به ایجنتهای محلی
- نیاز سختافزاری به بیش از ۲۴ گیگابایت VRAM یا حافظه یکپارچه جهت اجرای پایدار مدل محلی و ابزارها
افزودن امکان اجرای محلی ایجنتها به Google Antigravity SDK
شرکت Google قابلیت اجرای محلی مدلها را به مستندات Antigravity SDK اضافه کرد؛ قابلیتی که به توسعهدهندگان امکان میدهد پس از دانلود پکیجها و وزنهای مدل، پایپلاینها و جریانهای کاری ایجنتها را بدون اتکا به استنتاج ابری اجرا کنند. این کیت توسعه بهطور پیشفرض از مدل Gemma 4 26B A4B بهعنوان مدل محلی و از LiteRT متعلق به Google AI Edge بهعنوان رانتایم روی دستگاه استفاده میکند.
یک جریان کاری ایجنت بهطور پیوسته پرامپتها را به مدل ارسال میکند، ابزارها را فرا میخواند، نتایج را میسنجد و درباره گام بعدی تصمیم میگیرد. اجرای این حلقه بهصورت محلی باعث حفظ سورسکد و پرامپتها روی خود دستگاه میشود، هزینههای مبتنی بر توکن API را به صفر میرساند و امکان فعالیت در محیطهایی با اتصال اینترنت محدود را فراهم میسازد. با این حال، ابزارهایی که سرویسهای ریموت را فراخوانی میکنند همچنان داده ردوبدل خواهند کرد؛ بنابراین استنتاج آفلاین مدل لزوماً تمام اجزای یک ایجنت را آفلاین نمیکند.
یک حلقه ایجنت، دو رانتایم متفاوت
یکپارچهسازی اولیه، مدل Gemma 4 26B A4B را مستقیماً از طریق LiteRT اجرا میکند. علاوهبر این، Antigravity میتواند به سرورهای سازگار با OpenAI نیز متصل شود؛ ویژگی مهمی که به توسعهدهندگان اجازه میدهد از Ollama، LM Studio یا vLLM استفاده کنند بدون آنکه نیازی به تغییر حلقه اصلی ایجنت، ابزارها و سیاستهای امنیتی باشد.
بکاند | نحوه اجرا | بهترین کاربرد |
|---|---|---|
LiteRT | بارگذاری مدل پشتیبانیشده Gemma از طریق رانتایم روی دستگاه Google | استقرار مستقیم و محلی با مدل پیشفرض مستندسازیشده |
سرور سازگار با OpenAI | اتصال Antigravity به اندپوینتهای استنتاج مدیریتشده مستقل | نصبها و زیرساختهای فعال Ollama، LM Studio، llama.cpp یا vLLM |
سازگاری با API شرکت OpenAI تنها لایه اتصال را پوشش میدهد، درحالیکه رفتار مدل و قابلیت اطمینان در فراخوانی ابزارها همچنان به مدل انتخابی، فرمت پرامپت و پیادهسازی سرور وابسته است. بنابراین به تیمهای توسعه توصیه میشود هنگام تغییر بکاندها، تستهای فراخوانی ابزار و خطمشیها را مجدداً اجرا کنند.
پیکربندی و منابع سختافزاری مورد نیاز
شرکت Google برای اجرای مدل پیشفرض، بیش از ۲۴ گیگابایت حافظه گرافیکی (VRAM) یا حافظه یکپارچه (Unified Memory) را پیشنهاد میکند. حافظه در دسترس باید علاوه بر مدل، فضای لازم برای رانتایم، کش کانتکست، پردازشهای ابزارها و ایجنتهای همزمان را نیز تأمین کند؛ از این رو جریانهای کاری دارای چند ایجنت محلی ممکن است به ظرفیت رم بالاتری نیاز داشته باشند.
دستورهای شل زیر برای ایجاد محیط مجازی، نصب پکیجها و ایمپورت مدل از Hugging Face مورد استفاده قرار میگیرند:
python -m venv .venv
source .venv/bin/activate
python -m pip install google-antigravity litert-lm
litert-lm import \
--from-huggingface-repo=litert-community/gemma-4-26B-A4B-it-litert-lm \
gemma-4-26B-A4B-it-gpu.litertlm \
gemma4-26bپس از اتمام فرآیند ایمپورت، توسعهدهندگان فایل مدل را به LiteRTAgentConfig معرفی کرده و این پیکربندی را به کانتکست منیجر Agent ارسال میکنند. ایجنت توکنهای تولیدشده را بهصورت غیرهمگام (Asynchronous) برمیگرداند که این امر به نرمافزار اجازه میدهد همزمان با ادامه فرآیند استنتاج، رابط کاربری را بهروزرسانی کرده یا درخواستهای ابزارها را پردازش کند.
کیت Antigravity دسترسی ابزارهای فایلسیستم را به ورکاسپیس پیکربندیشده محدود میکند و یک قلاب سیاستی (Policy Hook) را برای تأیید عملیات در اختیار میگذارد. این مرزبندی تنها ابزارهای فایلی SDK را پوشش میدهد؛ اعمال کنترلهای سختگیرانهتر روی زیرپردازشها، دسترسی شبکه و منابع سیستمعامل نیازمند سندباکسهای مجزا خواهد بود.
اجرای محلی موازنهها و محدودیتها را تغییر میدهد
دغدغه | اجرای محلی | ملاحظات باقیمانده |
|---|---|---|
هزینه | حذف کامل هزینههای توکن و محدودیت نرخ درخواست سرویسها (Rate Limits) | سختافزار، مصرف برق و نگهداری همچنان هزینهبر هستند |
مدیریت دادهها | امکان نگهداری پرامپتها، کدها و خروجیهای مدل روی سیستم | ابزارهای ریموت، تلهمتری و پلنرهای ترکیبی نیازمند بازبینی امنیتی مستقل هستند |
اتصال شبکه | قابلیت اجرا پس از بارگیری پکیجها و وزنهای مدل بهصورت آفلاین | نصب اولیه، بهروزرسانیها و ابزارهای خارجی ممکن است به اینترنت نیاز داشته باشند |
عملکرد | حذف تأخیر شبکه و صفهای طولانی سرویسهای ابری | سرعت تولید متن کاملاً به پهنای باند حافظه و توان محاسباتی سختافزار محلی وابسته است |
جداسازی برنامهریزی از دسترسی به کد
الگوی پیشنهادی Google تحت عنوان «معمار-سازنده» (Architect-Builder)، وظیفه برنامهریزی را به یک مدل ابری و پردازشهای فشرده کدنویسی را به ایجنتهای محلی واگذار میکند. در دموی رسمی منتشرشده، مدل Gemini 3.8 Flash وظیفه شکستن و تفکیک تسکها را صرفاً با تکیه بر نام فایلها و توضیحات تسک انجام میدهد، درحالیکه نمونههای محلی Gemma 4 26B سه ماژول پایتون حاوی آسیبپذیری در حوزههای احراز هویت، سیستم پرداخت و دسترسی به پایگاه داده را بررسی، اصلاح و تست میکنند.
- پلنر ابری متادیتای تسک را دریافت کرده، استراتژی مناسب را انتخاب میکند و وظایف مشخص را بدون دسترسی به سورسکد تحویل میدهد.
- ایجنتهای محلی آسیبپذیریها را بازتولید کرده، پچهای اولیه را مینویسند، تغییرات پیشنهادی را ارزیابی کرده و تستهای رگرسیون را اجرا میکنند.
- اورکستریتور (Orchestrator) نتایج محلی را گردآوری کرده و تصمیم میگیرد که آیا به چرخه ممیزی دیگری نیاز است یا خیر.
در گزارش ثبتشده، فرآیند برنامهریزی تنها از ۹۵ توکن ابری استفاده کرد؛ درحالیکه ۳٬۳۲۲ توکن محلی برای پیادهسازی و اعتبارسنجی مصرف شد. بدین ترتیب ۹۷٫۲ درصد از حجم استنتاج به مدلهای محلی اختصاص یافت و تنها اسامی فایلها و شرح تسکها به مدل ابری ارسال گردید. بااینحال سازمانهایی با خطمشیهای سختگیرانه داده باید ارزیابی کنند که آیا خروج این متادیتا از دستگاه مجاز است یا خیر.
حلقه بازرسی و ممیزی تقابلی، وظایف را به مراحل کوچک و آزمونپذیر تقسیم میکند: یک ایجنت راهحل را پیشنهاد میدهد، ایجنت دیگر سناریوهای شکست آن را بررسی میکند و ایجنت سوم سهگانه آزمونهای رگرسیون را به اجرا درمیآورد. این ساختار حجم کانتکست مورد نیاز هر ایجنت محلی را کاهش داده و سیگنالهای ملموسی نظیر شکست تستها، رخنههای بازتولیدشده و تغییرات پچ را به سیستم ارکستراسیون ارائه میکند.
جایگاه واقعی مدلهای محلی در جریان کار
شرکت Google تولید کدهای مستقل و خودکفا را به عنوان یکی از کاربردیترین موارد استفاده برجسته میکند. در یک نمونه، ایجنت موفق شد با یک پرامپت ساده، یک مانیتور زنده منابع سیستم تحت ترمینال بسازد؛ برنامهای پایتونی با کتابخانههای psutil و rich بنویسد، فایل requirements.txt را تولید کند و نتیجه نهایی را تست نماید. این تسک دارای وابستگیهای شفاف، خروجی قابل مشاهده و مسیر راستیآزمایی مشخص بود.
با این حال، پیشنیاز سختافزاری اعلامشده دسترسی سیستمهای فاقد پردازنده گرافیکی مجزا یا حافظه یکپارچه کافی را ناممکن میسازد. همچنین نمونه منتشرشده Google هشدار میدهد که زمان اجرای فرآیندها ممکن است چند دقیقه طول بکشد و وظایفی با کانتکست بسیار طولانی، نیازمند دانش عمومی گسترده یا برنامهریزیهای بسیار پیچیده، همچنان با مدلهای قدرتمند ابری بازدهی بهتری خواهند داشت. پارامترهایی چون کوانتیزاسیون، طول کانتکست، تعداد پردازشهای همزمان و نوع سرور استنتاج انتخابی مستقیماً بر میزان مصرف رم و تأخیر اثرگذار خواهند بود.
انتخاب الگوی استقرار مناسب
- کاملاً محلی: استفاده از LiteRT یا سرور محلی سازگار با OpenAI برای شرایطی که پرامپتها، کدها، فراخوانی ابزارها و خروجیها الزاماً باید داخل دستگاه باقی بمانند.
- رویکرد ترکیبی: بهکارگیری مدل ابری برای برنامهریزی و ایجنتهای محلی برای دسترسی و اصلاح کدهای منبع، در صورتی که قوانین سازمانی اشتراکگذاری محدود متادیتا را مجاز بداند.
- سرورهای استنتاج موجود: اتصال Antigravity به سامانههای مستقر نظیر Ollama، LM Studio، llama.cpp یا vLLM جهت حفظ زیرساختهای جاری تیمها.
پشتیبانی از هر دو اندپوینت LiteRT و سازگار با OpenAI، لایه هماهنگسازی و ارکستراسیون مشترکی میان این پیکربندیها فراهم میآورد. به توسعهدهندگانی که قصد ارزیابی این SDK را دارند پیشنهاد میشود پیش از انتخاب نهایی بکاند، شاخصهایی چون نرخ موفقیت در تسکها، دقت در فراخوانی ابزارها، اوج مصرف حافظه، میزان تأخیر و امنیت دادهها را روی مخازن کدهای خود به دقت بسنجند. جزئیات پیادهسازی و بهروزرسانیهای تکمیلی در مخزن رسمی GitHub پروژه در دسترس قرار دارد.
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.