شاهکار جدید آنتروپیک: کلود حالا ارتش ۱۰۰۰ نفرهای از ایجنتها را برای شکار باگها رهبری میکند!
آنتروپیک قابلیت هیجانانگیز «ایجنتهای مدیریتشده» در کلود را وارد نسخه بتای عمومی کرد؛ قابلیتی که میتواند تا ۱۰۰۰ ایجنت تخصصی را برای پروژههای بزرگ برنامهنویسی هماهنگ کند. در آزمایشهای انجامشده روی یک پروژه با ۱۱۶ هزار خط کد، این سیستم هوشمند موفق شد ۶۶ مورد از ۷۰ باگ مخفیشده را شناسایی کند و رکوردی شگفتانگیز در دنیای توسعه نرمافزار به جا بگذارد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- ورود ارتش ۱۰۰۰ ایجنتی به بتای عمومی: آنتروپیک جریانهای کاری پویای کلود (Claude Managed Agents) را در دسترس عموم قرار داده که به یک ایجنت رهبر اجازه میدهد کارها را خرد کند و تا ۱۰۰۰ ایجنت فرعی را در چند مرحله به کار بگیرد.
- شکار خیرهکننده باگها در بنچمارک سنگین: در کدهای یک پروژه با ۱۱۶ هزار خط کد و ۷۰ باگ مخفی، یک ایجنت تکی نهایتاً ۲۷ باگ پیدا کرد، اما شبکه ایجنتهای کلود در هر ۳ دور آزمایش دقیقاً ۶۶ باگ (بیش از ۹۴ درصد خطاها) را شکار کرد.
- برنامهنویسی جاوااسکریپت پشت صحنه: کلود برای هر پروژه بزرگ یک اسکریپت هماهنگی به زبان جاوااسکریپت مینویسد و در پسزمینه اجرا میکند؛ البته توسعهدهندگان باید حواسشان به مصرف بالای توکن و مدیریت دقیق دسترسیها هم باشد.
هماهنگی تا ۱۰۰۰ ایجنت هوشمند؛ جهش بزرگ در جریانهای کاری کلود
شرکت آنتروپیک (Anthropic) جریانهای کاری پویای خود موسوم به «ایجنتهای مدیریتشده کلود» (Claude Managed Agents) را از فاز پیشنمایش تحقیقاتی خارج کرد و در قالب بتای عمومی روی پلتفرم کلود در دسترس همه قرار داد. در این ساختار، یک ایجنت سرپرست یا لیدر (Lead Agent) وارد عمل میشود: ابتدا کل تسک را برنامهریزی میکند، سپس کار را بین چند سابایجنت تخصصی تقسیم کرده و این مأموریتها را در چند فاز مجزا جلو میبرد؛ در نهایت هم نتایج را اعتبارسنجی کرده و گزارش نهایی را تحویل میدهد. توسعهدهندگان میتوانند با فعالسازی نوع چندایجنت نسخهبندیشده multiagent_20261001 از این قابلیت استفاده کنند.
نسخه بتای عمومی سقف ایجنتها را در هر بار اجرا به رقم خیرهکننده ۱۰۰۰ ایجنت مدیریتشده رسانده است. برای مقایسه، بد نیست بدانید در پیشنمایش تحقیقاتی اولیه که روی سیستمهای محلی اجرا میشد، به خاطر محدودیت منابع تنها امکان اجرای همزمان حدود ۱۶ سابایجنت وجود داشت. البته این دو عدد مفهوم متفاوتی دارند؛ سقف جدید در واقع تعداد کل ایجنتهایی است که در طول یک اجرای کامل هدایت و سازماندهی میشوند و لزوماً به این معنی نیست که همه ۱۰۰۰ ایجنت در یک ثانیه با هم در حال فعالیت باشند.
مشخصه | نسخه بتای عمومی |
|---|---|
مدل هماهنگی | ایجنت سرپرست به همراه سابایجنتهای فازبندیشده |
حداکثر مقیاس | تا ۱۰۰۰ ایجنت در هر بار اجرا |
نوع پیکربندی | multiagent_20261001 |
نحوه اجرا | جریان کاری مدیریتشده در پسزمینه |
بهای اصلی (Trade-off) | مصرف توکن بیشتر و زمان اجرای طولانیتر |
آزمایشی با ۷۰ باگ واقعی؛ وقتی ایجنتهای موازی کولاک میکنند!
تیم آنتروپیک برای اینکه عیار واقعی سیستم را بسنجد، ۷۰ باگ مختلف را داخل یک پروژه نرمافزاری بزرگ با ۱۱۶ هزار خط کد کاشت. نتیجه شگفتانگیز بود: وقتی یک تکایجنت عادی را به جان کدها انداختند، در سه دور آزمایش به ترتیب تنها ۱۴، ۱۵ و ۲۷ باگ پیدا کرد؛ اما وقتی جریان کاری چندایجنت پویا به میدان آمد، در هر سه دور آزمایش بدون هیچ افتی دقیقاً ۶۶ باگ از ۷۰ باگ را شکار کرد!
روش اجرا | دور اول | دور دوم | دور سوم | نرخ بازیابی (Recall) |
|---|---|---|---|---|
تکایجنت | ۱۴ | ۱۵ | ۲۷ | ۲۰.۰٪ تا ۳۸.۶٪ |
جریان کاری پویا | ۶۶ | ۶۶ | ۶۶ | ۹۴.۳٪ |
این آزمایش نشان داد که جریان کاری پویا نهتنها دقت و نرخ یادآوری (Recall) بسیار بالاتری دارد، بلکه خروجی کاملاً باثبات و بدون نوسانی را ارائه میدهد. ایجنتهای موازی میتوانند همزمان بخشهای جداگانهای از ریپازیتوری را شخم بزنند، یافتههای مشترکشان را با هم مقایسه کنند و پیش از آنکه ایجنت لیدر گزارش نهایی را سرهم کند، خطاهای مشکوک را با دقت بسنجند.
البته آنتروپیک یادآوری میکند که این نتایج آزمایشی قرار نیست روی تمام پروژهها و با هر ساختار کدی دقیقاً همینطور تکرار شود. از طرفی، هنوز ابهاماتی پیرامون دقت خالص، مصرف توکن، زمان تأخیر، گزارش باگهای تکراری و زمانی که تیم توسعه باید برای تأیید اصلاحیههای پیشنهادی صرف کند، وجود دارد. بنابراین تیمهای مهندسی حتماً باید این متغیرها را بر اساس ریپازیتوری و کدهای اختصاصی خودشان ارزیابی کنند.
کلود خودش نقشه راه اجرا را مینویسد
جریان کاری پویا در واقع یک برنامه هماهنگی به زبان جاوااسکریپت است که کلود خودش متناسب با تسک درخواستی شما تولید میکند. سپس محیط اجرایی ابری این برنامه را در پسزمینه اجرا میکند تا سشن اصلی شما درگیر نشود و بتوانید همزمان با کار کردن سابایجنتها روی مأموریتهایشان، به کارهای دیگرتان برسید.
در این الگو، به هر سابایجنت بخش مشخص و محدودی از هدف کلی همراه با یک کانتکست کاری مستقل داده میشود. ایجنت لیدر میتواند مأموریتها را فازبندی کند، از ایجنتهای بعدی بخواهد که خروجی ایجنتهای قبلی را بازبینی کنند و هرچه شواهد بیشتری به دست میآید، نقشه راه را بهروزرسانی کند. این ساختار باعث میشود گستره پوشش کدهای پروژه از ظرفیت محدود کانتکست پنجره یک تکایجنت بسیار فراتر برود.
البته نقشهای که به صورت خودکار تولید میشود دقیقاً مثل هر کد و منطق خودکار دیگری به نظارت و بررسی دقیق نیاز دارد. توسعهدهندگان باید قبل از اینکه بودجه توکن سنگینی به پروژه اختصاص دهند یا دسترسی وسیعی به کل مخزن کد باز کنند، مرزهای تسک، ابزارهای مجاز، خروجیهای مورد انتظار و معیارهای اعتبارسنجی را بهدقت چک کنند.
ایجنتهای موازی به درد چه کارهایی میخورند؟
جریانهای کاری مدیریتشده خوراک تسکهایی هستند که به تحقیقات متعددِ مستقل یا همپوشان تقسیم میشوند. چند مورد از بهترین سناریوها برای استفاده از این قابلیت عبارتاند از:
- شکار و ردیابی باگ در سراسر مخزن کد که نیازمند بررسی فایل به فایل است
- مهاجرت فریمورکها، زبانهای برنامهنویسی یا ارتقای API که میتوان کار را بر اساس پکیج یا ماژول خرد کرد
- ممیزیهای امنیتی که به چند بازبین مستقل و مراحل راستیآزمایی چندگانه نیاز دارند
- بررسی و بهینهسازی عملکرد (پرفورمنس) در میان سرویسها، لاگها، تریسها و فایلهای کانفیگ
- ارتقای پکیجها و وابستگیها (Dependencies) همراه با تستهای سازگاری جداگانه
- پروژههای پژوهشی و تحقیقاتی که نیازمند مقایسه منابع متعدد یا نظریههای متناقض هستند
در نقطه مقابل، برای تغییرات کوچک و محدود، کماکان استفاده از یک تکایجنت انتخاب بهتری است؛ چون هماهنگسازی ایجنتها به زمان برنامهریزی بیشتر، ترکیب خروجیها و مصرف توکن بیشتری نیاز دارد. بنابراین ادیت یک فایل تکی یا پرسیدن سؤالی که کل پاسخش در کانتکست یک ایجنت جا میشود، اگر به یک جریان چندایجنت سپرده شود، هم خرج بیشتری روی دستتان میگذارد و هم دیرتر آماده خواهد شد.
حواستان به سقف بودجه توکن و سطح دسترسیها باشد
هر چقدر تعداد ایجنتها، حجم کانتکست آنها، تعداد فازها و راستیآزماییهای متقابل بالاتر برود، مصرف توکن هم سر به فلک میکشد! به همین دلیل، آنتروپیک پیشنهاد میکند ابتدا کار را با یک تسک کاملاً جمعوجور و محدود شروع کنید و پس از اندازهگیری دقیق هزینه، زمان اجرا و کیفیت خروجی، به مرور دامنه کار را گسترش دهید.
در نسخه پیشنمایش قبلی، سابایجنتها در حالت acceptEdits اجرا میشدند و لیست ابزارهای مجاز (Allowlist) ایجنت مادر را به ارث میبردند؛ فارغ از اینکه سطح دسترسی کلی سشن چه چیزی تعیین شده بود. در نتیجه ویرایش فایلها به صورت خودکار جلو میرفت، اما دستورات خط فرمان (Shell)، درخواستهای وب و ابزارهای پروتکل کانتکست مدل (MCP) که خارج از لیست مجاز بودند، برای دریافت تأیید متوقف میشدند.
با توجه به اینکه رفتار سیستم در بتای عمومی ممکن است دستخوش تغییر شود، تیمها باید قبل از رها کردن ایجنتها به صورت خودکار، سازوکار دسترسیها را حسابی چک کنند. استفاده از لیست ابزارهای محدود، ایزولهسازی اطلاعات هویتی و کلیدها، بکاپگیری از ریپازیتوری، محافظت از برنچها، تعیین سقف هزینه (Spending Caps) و ذخیره دقیق لاگهای اجرا باعث میشود ریسک خطاهای احتمالی به حداقل برسد.
چطور اولین اجرای کنترلشده را استارت بزنیم؟
کاربران ابزار خط فرمان Claude Code میتوانند تمپلیت آماده شکارچی باگ (bug-hunter) آنتروپیک را با اجرای دستور آنبوردینگ زیر فراخوانی کنند:
/claude-api managed-agents-onboard bug-hunterتوسعهدهندگانی هم که میخواهند مستقیماً از طریق API این قابلیت را در پروژههایشان یکپارچه کنند، میتوانند از ساختار چندایجنت زیر به عنوان هسته اصلی درخواست خود بهره ببرند. فیلدهای جانبی ممکن است بسته به SDK یا اندپوینت متفاوت باشد، به همین خاطر مستندات راهاندازی سریع ایجنتها (Agent quickstart) همچنان بهترین مرجع برای مشاهده جزئیات کامل احراز هویت و ارسال درخواست است:
{
"agent": {
"multiagent": {
"type": "multiagent_20261001"
}
},
"task": "Audit this repository for SQL injection vulnerabilities"
}پس از ارسال درخواست، کلود اسکریپت هماهنگی را ایجاد میکند، تصمیم میگیرد کار را چطور تقسیم کند، سابایجنتها را فاز به فاز به پیش میبرد و در نهایت گزارش یکپارچهای تحویل میدهد. برای اولین تست، بهتر است محدوده ریپازیتوری، مسیرهای استثنا، ابزارهای مجاز، فرمت خروجی، استانداردهای راستیآزمایی و سقف مصرف توکن را کاملاً مشخص کنید.
بتای عمومی کلود؛ تبدیل هوش مصنوعی به یک جابرانر تمامعیار
این آپدیت تازه یک لایه هماهنگی مدیریتشده در اختیار مهندسان نرمافزار میگذارد تا پروژههایی را که فراتر از کانتکست یک ایجنت هستند، بهسادگی مدیریت کنند. رساندن سقف مقیاس به ۱۰۰۰ ایجنت امکان اجرای پروژههای بزرگ را فراهم کرده و نوع کانفیگ نسخهبندیشده نیز یک نقطه اتصال مطمئن و قابل تکرار برای تست به وجود آورده است.
با این حال، فاز بتای عمومی هنوز با برخی چالشهای عملیاتی نظیر احتمال تغییرات در API، هزینههای بالا، مدیریت دسترسیها و تفاوت دقت در کارهای مختلف همراه است. به تیمها پیشنهاد میشود خروجی این سیستم را در پروژههای مشابه با یک تکایجنت مقایسه کنند و فاکتورهایی مثل نرخ بازیابی، دقت خالص، زمان اجرا، مصرف توکن و زمان لازم برای بررسی انسانی را زیر نظر بگیرند؛ زیرا فقط با این دادهها میتوان فهمید که آیا پیچیدگی و هزینه هماهنگسازی موازی، ارزشش را دارد یا نه.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

دستهگلهای جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
پس از دستهگلهای اخیر مدلهای هوش مصنوعی آنتروپیک و نفوذ ناخواسته آنها به سامانههای دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعهدهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدلهای خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
استارتاپ پرایم اینتلکت در اقدامی شگفتانگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریمورک پرایم ایجنت را ظرف دو هفته از تایپاسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متنباز است.

هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو میسازد؛ آنهم با ۷۵ سنت!
پروژه متنباز جدیدی به نام ai-newtab با تکیه بر هوش مصنوعی کلود، هر روز صفحه تب جدید کروم را متناسب با علایق و تاریخچه وبگردی شما از نو میسازد. این ابزار با هزینه روزانه حدود ۰.۷۵ دلار، یک صفحه خانگی شخصیسازیشده و جذاب آماده میکند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.