سنگ محک جدید برای هوش مصنوعی در برابر هکرها: ایجنتها چقدر در دفاع سایبری ماهرند؟
ائتلافی از غولهای فناوری و پژوهشگران دانشگاهی از شاخص جدیدی برای سنجش دقیق دفاع سایبری در ایجنتهای هوش مصنوعی رونمایی کردند. این بنچمارک استاندارد نشان میدهد مدلهای مختلف تا چه حد در کشف و رفع خودکار باگهای امنیتی موفق عمل میکنند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- ائتلاف جدیدی با همکاری بازیگران صنعت و مراکز آکادمیک کلید خورده تا استانداردی تازه برای ارزیابی عملکرد ایجنتهای هوش مصنوعی در حوزه دفاع سایبری شرکتی ایجاد کنه.
- این شاخص در گام نخست از سه بنچمارک کاربردی برای محک زدن مهارت ایجنتها در اسکن سورسکد، بازتولید آسیبپذیریها و نوشتن پچ امنیتی استفاده میکنه.
- تمرکز اصلی این پروژه کاملاً روی دفاع سایبری و کدهای متنبازه و سناریوهای تهاجمی یا نوشتن اکسپلویت از دایره ارزیابی کنار گذاشته شدهان.
معرفی شاخص جامع دفاع سایبری هوش مصنوعی
اتحاد شاخص سایبری؛ همکاری نخبگان برای امنیت دیجیتال
شاخص دفاع سایبری چطور کار میکند؟
نگاهی کلی به بنچمارکها
در فاز رونمایی، این شاخص دفاع سایبری سه آزمون ارزیابی امنیتی معتبر را از دل پژوهشهای دانشگاهی و شرکای صنعتی گرد هم آورده است. این آزمونها در کنار هم کل زنجیره دفاع سایبری را پوشش میدهند؛ از اسکن دقیق سورسکد برای کشف آسیبپذیریها گرفته تا بازتولید خطای برنامه و نوشتن وصله یا پچ امنیتی کارآمد.
ارزیابی | چه چیزی را میسنجد؟ | قابلیتهای اصلی | زیرقابلیتها |
|---|---|---|---|
CWE-Bench-AA توسعهدادهشده توسط Collinear AI | بررسی امنیتی مخازن واقعی و متنباز برای کشف آسیبپذیری در حوزههای مشخص و رفع آن بدون ایجاد اختلال در کارکرد برنامه. شامل ۱۲۰ تسک اختصاصی که تمام ۱۰ دسته آسیبپذیری برتر OWASP Top 10 (2025) را در بر میگیرد. | شناسایی و برطرف کردن آسیبپذیریها |
|
DeepsecBench-AA توسعهدادهشده توسط Vercel | پیدا کردن باگهای امنیتی در کد اپلیکیشنهای متنباز بر مبنای مجموعهای از یافتههای اعتبارسنجیشده توسط کارشناسان خبره امنیت. | شناسایی آسیبپذیریها |
|
CyberGym-E2E-AA توسعهدادهشده توسط Berkeley RDI | کشف، بازتولید و پچ کردن آسیبپذیریهای مربوط به ایمنی حافظه در پروژههای متنباز C و C++. شامل ۱۳۱ تسک مستقل که از میان دیتاست ۹۲۰ تایی CyberGym-E2E استخراج شدهاند. | شناسایی و برطرف کردن آسیبپذیریها |
|
هر ارزیابی بر مبنای مهارتها و زیرقابلیتهای مورد آزمایش دستهبندی شده تا نقاط قوت شاخص و حوزههایی که هنوز جای کار دارند کاملاً شفاف باشند. این بنچمارک در حال حاضر روی کشف و اصلاح آسیبپذیریها با دسترسی مستقیم به سورسکد تمرکز دارد. در مراحل بعدی، ارزیابی پاسخ به حوادث امنیتی، نگارش کدهای جدیدِ ذاتاً امن، و آزمودن اهدافی بدون دسترسی به سورس (مانند نرمافزارهای کامپایلشده و سرورهای زنده) به سیستم افزوده خواهد شد. از آنجا که تمرکز این شاخص کاملاً تدافعی است، ساخت ابزار اکسپلویت و سواستفاده از رخنه از حوزه کاری آن بیرون گذاشته شده است.
متدولوژی و نحوه ارزیابی
هر سه آزمون روی چارچوب متنباز Stirrup اجرا میشوند که بستری اختصاصی برای ارزیابی عملکرد ایجنتهاست.
با توجه به اینکه ابزارهای سایبری ماهیتی دومنظوره (دفاعی و تهاجمی) دارند، مواردی که یک مدل یا ارائهدهنده سرویس به دلایل ایمنی از پذیرش تسک خودداری میکند نیز ثبت شده و مجزا از امتیاز عملکردی اعلام میشوند. علاوه بر این، با توجه به ماهیت باز تسکها، در ارزیابی CyberGym-E2E-AA این امکان برای مدلها در نظر گرفته شده که اگر به این نتیجه رسیدند که آسیبپذیری خاصی وجود ندارد، مأموریت را بدون ثبت خطا به پایان برسانند.
جزئیات دقیق فنی در بخش مستندات روششناسی ارزیابی تشریح شده است.
بنچمارک CWE-Bench-AA: ممیزی و رفع باگ در مخازن واقعی
بنچمارک DeepsecBench-AA: شکار رخنههای تاییدشده توسط متخصصان
بنچمارک CyberGym-E2E-AA: کشف، بازتولید و پچ خودکار آسیبپذیریهای حافظه
منابع و مستندات شاخص دفاع سایبری
نقشه راه توسعه و گامهای بعدی
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.