پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

سنگ محک جدید برای هوش مصنوعی در برابر هکرها: ایجنت‌ها چقدر در دفاع سایبری ماهرند؟

انتشار:۶ مهر ۱۴۰۵(۵ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

ائتلافی از غول‌های فناوری و پژوهشگران دانشگاهی از شاخص جدیدی برای سنجش دقیق دفاع سایبری در ایجنت‌های هوش مصنوعی رونمایی کردند. این بنچمارک استاندارد نشان می‌دهد مدل‌های مختلف تا چه حد در کشف و رفع خودکار باگ‌های امنیتی موفق عمل می‌کنند.

سنگ محک جدید برای هوش مصنوعی در برابر هکرها: ایجنت‌ها چقدر در دفاع سایبری ماهرند؟

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • ائتلاف جدیدی با همکاری بازیگران صنعت و مراکز آکادمیک کلید خورده تا استانداردی تازه برای ارزیابی عملکرد ایجنت‌های هوش مصنوعی در حوزه دفاع سایبری شرکتی ایجاد کنه.
  • این شاخص در گام نخست از سه بنچمارک کاربردی برای محک زدن مهارت ایجنت‌ها در اسکن سورس‌کد، بازتولید آسیب‌پذیری‌ها و نوشتن پچ امنیتی استفاده می‌کنه.
  • تمرکز اصلی این پروژه کاملاً روی دفاع سایبری و کدهای متن‌بازه و سناریوهای تهاجمی یا نوشتن اکسپلویت از دایره ارزیابی کنار گذاشته شده‌ان.

معرفی شاخص جامع دفاع سایبری هوش مصنوعی

اتحاد شاخص سایبری؛ همکاری نخبگان برای امنیت دیجیتال

شاخص دفاع سایبری چطور کار می‌کند؟

نگاهی کلی به بنچمارک‌ها

در فاز رونمایی، این شاخص دفاع سایبری سه آزمون ارزیابی امنیتی معتبر را از دل پژوهش‌های دانشگاهی و شرکای صنعتی گرد هم آورده است. این آزمون‌ها در کنار هم کل زنجیره دفاع سایبری را پوشش می‌دهند؛ از اسکن دقیق سورس‌کد برای کشف آسیب‌پذیری‌ها گرفته تا بازتولید خطای برنامه و نوشتن وصله یا پچ امنیتی کارآمد.

ارزیابی
چه چیزی را می‌سنجد؟
قابلیت‌های اصلی
زیرقابلیت‌ها

CWE-Bench-AA

توسعه‌داده‌شده توسط Collinear AI
بررسی امنیتی مخازن واقعی و متن‌باز برای کشف آسیب‌پذیری در حوزه‌های مشخص و رفع آن بدون ایجاد اختلال در کارکرد برنامه. شامل ۱۲۰ تسک اختصاصی که تمام ۱۰ دسته آسیب‌پذیری برتر OWASP Top 10 (2025) را در بر می‌گیرد.
شناسایی و برطرف کردن آسیب‌پذیری‌ها
  • کشف و پویش آسیب‌پذیری‌ها
  • پیاده‌سازی پچ یا راهکار کاهش مخاطره

DeepsecBench-AA

توسعه‌داده‌شده توسط Vercel
پیدا کردن باگ‌های امنیتی در کد اپلیکیشن‌های متن‌باز بر مبنای مجموعه‌ای از یافته‌های اعتبارسنجی‌شده توسط کارشناسان خبره امنیت.
شناسایی آسیب‌پذیری‌ها
  • کشف و اسکن آسیب‌پذیری‌ها

CyberGym-E2E-AA

توسعه‌داده‌شده توسط Berkeley RDI
کشف، بازتولید و پچ کردن آسیب‌پذیری‌های مربوط به ایمنی حافظه در پروژه‌های متن‌باز C و C++. شامل ۱۳۱ تسک مستقل که از میان دیتاست ۹۲۰ تایی CyberGym-E2E استخراج شده‌اند.
شناسایی و برطرف کردن آسیب‌پذیری‌ها
  • کشف و پویش آسیب‌پذیری‌ها
  • بازتولید و اعتبارسنجی دقیق آسیب‌پذیری
  • پیاده‌سازی پچ یا راهکار کاهش مخاطره

هر ارزیابی بر مبنای مهارت‌ها و زیرقابلیت‌های مورد آزمایش دسته‌بندی شده تا نقاط قوت شاخص و حوزه‌هایی که هنوز جای کار دارند کاملاً شفاف باشند. این بنچمارک در حال حاضر روی کشف و اصلاح آسیب‌پذیری‌ها با دسترسی مستقیم به سورس‌کد تمرکز دارد. در مراحل بعدی، ارزیابی پاسخ به حوادث امنیتی، نگارش کدهای جدیدِ ذاتاً امن، و آزمودن اهدافی بدون دسترسی به سورس (مانند نرم‌افزارهای کامپایل‌شده و سرورهای زنده) به سیستم افزوده خواهد شد. از آنجا که تمرکز این شاخص کاملاً تدافعی است، ساخت ابزار اکسپلویت و سواستفاده از رخنه از حوزه کاری آن بیرون گذاشته شده است.

متدولوژی و نحوه ارزیابی

هر سه آزمون روی چارچوب متن‌باز Stirrup اجرا می‌شوند که بستری اختصاصی برای ارزیابی عملکرد ایجنت‌هاست.

با توجه به اینکه ابزارهای سایبری ماهیتی دومنظوره (دفاعی و تهاجمی) دارند، مواردی که یک مدل یا ارائه‌دهنده سرویس به دلایل ایمنی از پذیرش تسک خودداری می‌کند نیز ثبت شده و مجزا از امتیاز عملکردی اعلام می‌شوند. علاوه بر این، با توجه به ماهیت باز تسک‌ها، در ارزیابی CyberGym-E2E-AA این امکان برای مدل‌ها در نظر گرفته شده که اگر به این نتیجه رسیدند که آسیب‌پذیری خاصی وجود ندارد، مأموریت را بدون ثبت خطا به پایان برسانند.

جزئیات دقیق فنی در بخش مستندات روش‌شناسی ارزیابی تشریح شده است.

بنچمارک CWE-Bench-AA: ممیزی و رفع باگ در مخازن واقعی

بنچمارک DeepsecBench-AA: شکار رخنه‌های تاییدشده توسط متخصصان

بنچمارک CyberGym-E2E-AA: کشف، بازتولید و پچ خودکار آسیب‌پذیری‌های حافظه

منابع و مستندات شاخص دفاع سایبری

نقشه راه توسعه و گام‌های بعدی

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر