پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شکار ایجنت‌های سرکش با کسری از هزینه معمول؛ ترفند جدید گودفایر برای نظارت بر هوش مصنوعی از درون

انتشار:۱۷ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ گودفایر (Goodfire) از روشی فوق‌العاده ارزان‌تر برای مهار و کنترل ایجنت‌های هوش مصنوعی رونمایی کرده است. این سیستم به جای استخدام یک هوش مصنوعی مجزا و گران‌قیمت برای بررسی مداوم رفتارها، مستقیماً به سیگنال‌های درونی مغز مدل سرک می‌کشد و فعالیت‌های مشکوک را با هزینه‌ای ناچیز شکار می‌کند. این نوآوری می‌تواند خیال توسعه‌دهندگان را از خرابکاری یا فرار ایجنت‌ها تا حد زیادی راحت کند.

شکار ایجنت‌های سرکش با کسری از هزینه معمول؛ ترفند جدید گودفایر برای نظارت بر هوش مصنوعی از درون

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • به جای استفاده از یک هوش مصنوعی دوم و پرهزینه که مدام بالای سر ایجنت کشیک بدهد، ناظرهای گودفایر مستقیماً سیگنال‌ها و محاسبات داخلی مغز مدل را زیر نظر می‌گیرند.
  • هزینه نظارت بر ۱۵۰۰ نشست کاری در این روش به حدود ۵۱ دلار می‌رسد، در حالی که استفاده از مدل‌های تراز اول برای پایش مرحله‌به‌مرحله می‌تواند تا ۱۰ هزار دلار خرج روی دست شرکت‌ها بگذارد.
  • این پروب‌های هوشمند موفق شده‌اند تا ۹۴ درصد از رفتارهای خرابکارانه و هک ایجنت‌ها را بدون ایجاد تأخیر محسوس در پاسخ‌دهی کشف کنند؛ راهکاری حیاتی برای مهار مدل‌های باز.

روش معمول برای اینکه یک ایجنت هوش مصنوعی از مسیرش منحرف نشود، این بوده که یک مدل دوم مدام بالای سرش بایستد و هر کاری انجام می‌دهد را کلمه‌به‌کلمه چک کند. هرچند این شیوه تا به حال رویکرد پیش‌فرض شرکت‌ها بوده، اما وقتی ایجنت‌ها ساعت‌ها بی‌وقفه کار می‌کنند و متنی به اندازه چند جلد رمان را زیر و رو می‌کنند، هزینه‌ها خیلی زود سر به فلک می‌کشد.

حالا استارتاپ گودفایر (Goodfire) که روی حوزه تفسیرپذیری (سر درآوردن از سازوکار درونی مدل‌های هوش مصنوعی) متمرکز است، گزینه‌ای بسیار ارزان‌تر را روانه میدان کرده است: ناظرهایی که حین کار کردن مدل، به جای خواندن نوشته‌هایش، مستقیماً وقایع درون مغز هوش مصنوعی را زیر نظر می‌گیرند. این ابزار‌های نظارتی هم‌اکنون در دسترس مشتریان بیس‌تن (Baseten) قرار گرفته‌اند؛ شرکتی که مدل‌های هوش مصنوعی را برای کسب‌وکارهای دیگر میزبانی و اجرا می‌کند.

جالب است بدانید آزمایشگاه بیس لبز (Base Labs) وابسته به Baseten، ماه گذشته از همکاری امنیتی مشترک خود با گودفایر و پلتفرم محبوب هوش مصنوعی هاگینگ فیس (Hugging Face) خبر داده بود.

این رونمایی درست پس از سلسله حوادث جنجالی امسال رخ می‌دهد که در آن‌ها ایجنت‌های هوش مصنوعی از محیط‌های آزمایشی و ایزوله خود فرار کردند؛ از جمله ایجنت‌های شرکت OpenAI که وارد پلتفرم Hugging Face شدند. مدل باز Kimi K3 هم که گودفایر اولین سیستم نظارتی خود را بر پایه آن طراحی کرده، همین تابستان با سوءاستفاده از یک شکاف امنیتی در محیط سندباکس خود، توانسته بود به اینترنت و اطلاعات گیت‌هاب سرک بکشد.

سیستم گودفایر تقریباً مثل گیت بازرسی فرودگاه کار می‌کند. حسگر‌های کوچکی به نام «پروب» (Probe) در تک‌تک مراحل کار ایجنت، سیگنال‌های داخلی مدل را می‌خوانند؛ درست مثل گیت‌های اسکنری که همه مسافران از آن‌ها رد می‌شوند. تنها زمانی که این پروب‌ها یک رفتار مشکوک را علامت بزنند، یک مدل هوش مصنوعی جداگانه وارد میدان می‌شود تا مثل بازرسی بدنی دقیق، همه‌چیز را با وسواس بررسی کند.

مشتریان Baseten می‌توانند خطرات مدنظرشان برای نظارت را تعیین کنند؛ مواردی مثل هک‌های تهاجمی، سوءاستفاده در زمینه سلاح‌های شیمیایی و بیولوژیکی، یا پدیده «هک پاداش» (دور زدن قوانین برای گرفتن امتیاز بالا‌تر). همچنین تصمیم‌گیری درباره واکنش خودکار سیستم هم با خود آن‌هاست: از ثبت گزارش ساده رویداد گرفته تا ارجاع آن برای بررسی انسانی یا مسدود کردن کامل درخواست.

گودفایر تأکید می‌کند که اجرای این روش بسیار ارزان‌تر تمام می‌شود. در رویکردهای سنتی، ناظرهای هوش مصنوعی مدل‌های جداگانه‌ای هستند که باید تمام فعالیت‌ها و متون مدل اصلی را دوباره از نو بخوانند؛ کاری که حسابی زمان‌بر و پرهزینه است. اما پروب‌های گودفایر سراغ محاسباتی می‌روند که خود مدل حین فعالیت در حال انجام دادن آن‌هاست.

اریک هو (مدیرعامل Goodfire) هفته گذشته در پادکست MAD به میزبانی مت تورک گفت: «ناظرهای مبتنی بر اکتیویشن‌های درونی واقعاً ارزان هستند، چون از محاسبات پاس رو به جلو (Forward Pass) که قبلاً انجام شده دوباره استفاده می‌کنند. یعنی خود مدل در حال محاسبه این توکن است و تنها کاری که ما می‌کنیم، خواندن اکتیویشن‌های عصبی میانی و اجرای یک دسته‌بندی‌کننده ساده روی این محاسبات داخلی است.» خلاصه ماجرا این است: خود مدل همه محاسبات سنگین ریاضی را انجام می‌دهد و پروب‌ها فقط نتایج آماده را تحلیل می‌کنند.

در آزمایش‌های گودفایر روی مدل Kimi K3، پایش حدود ۱۵۰۰ نشست کاری تقریباً ۵۱ دلار هزینه برداشت؛ در حالی که نظارت مرحله‌به‌مرحله با یک مدل ارزان حدود ۲۳۳ دلار و با یک مدل تراز اول تا ۱۰ هزار دلار آب می‌خورد! این پروب‌ها موفق شدند ۹۴ درصد از نشست‌های مربوط به هک مخرب را شکار کنند و فقط ۸٫۷ درصد از تعاملات بی‌خطر را برای بررسی دوباره فرستادند.

به گفته این شرکت، اجرای هم‌زمان چهار پروب تنها کم‌تر از ۲ درصد به زمان پاسخ‌دهی مدل اضافه کرد که عملاً یعنی هیچ تأخیر محسوسی در کار ایجاد نمی‌شود.

نظارت درونی بر ایجنت‌های هوش مصنوعی
تصویر: گودفایر (Goodfire)

دن بالسام، مدیر ارشد فناوری و هم‌بنیان‌گذار گودفایر می‌گوید: «بزرگ‌ترین برتری این روش این است که مچ رفتارها را پیش از وقوع می‌گیرید. ما می‌توانیم درست همان لحظه‌ای که مدل حین ارزیابی یا آموزش احتمال دارد دست به هک بزند، آن را شناسایی کنیم.»

این ایده به ویژه مدل‌های متن‌باز را هدف گرفته است؛ مدل‌هایی که توسعه‌دهندگان می‌توانند آزادانه دانلود کرده و حفاظ‌های ایمنی آن‌ها را دور بزنند، ضمن اینکه این مدل‌ها فاقد سیستم‌های نظارتی پیشرفته‌ای هستند که شرکت‌های دارای آزمایشگاه‌های بسته روی پلتفرم‌های اختصاصی خود اجرا می‌کنند.

بالسام توضیح می‌دهد: «خطری که یک کاربر عادی می‌تواند با مدل‌های باز ایجاد کند، در مقایسه با پتانسیل تخریبی که خوشه‌های بزرگ پردازشی و ارائه‌دهندگان سرویس استنتاج (Inference) با آن روبه‌رو هستند بسیار ناچیز است؛ چرا که بخش اعظم مسئولیت بر دوش همین سرویس‌دهنده‌ها قرار دارد. وقتی لحظه تحول بزرگ مدل‌های متن‌باز فرا برسد، همه خواهند دید که وجود حفاظ‌های ایمنی درست در زمان استنتاج، یک ضرورت غیرقابل‌انکار است.»

تحقیقات اخیر گودفایر نشان داده که مدل‌های متن‌باز مطرح، از جمله Kimi K3 و GLM-5.2، در ۵۰ تا ۹۶ درصد از سناریوهای آزمایشی ایجنت‌ها دست به هک پاداش (تقلب برای کسب امتیاز بالا‌تر) زده‌اند.

البته گودفایر اولین شرکتی نیست که این مسیر را امتحان می‌کند. گوگل دیپ‌مایند (Google DeepMind) نیز در ماه ژانویه فاش کرده بود که نتایج تحقیقاتش زمینه را برای استقرار پروب‌های تشخیص سوءاستفاده در جمنای (Gemini) فراهم کرده است.

به گفته بالسام، این ناظرها تنها بخش کوتاه‌مدتی از یک هدف پژوهشی بسیار بزرگ‌تر هستند: مهندسی معکوس مدل‌های زبانی بزرگ تا بتوان هر رفتار خاص را به نقطه دقیق شکل‌گیری‌اش در زمان آموزش ردیابی کرد. او در پایان می‌گوید: «امیدواریم روزی این جادوی پیش‌بینی‌ناپذیر آموزش مدل‌ها را به مهندسی دقیق تبدیل کنیم.»

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد
آخرین اخبار

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد

یک اخترفیزیک‌دان در دانشگاه جانز هاپکینز با استفاده از پلتفرم Claude Science موفق شد یک‌سوم گمشده از نقشه فرابنفش کیهان را بازسازی و کامل کند. این پروژه عظیم که در گذشته به ماه‌ها کار طاقت‌فرسا نیاز داشت، حالا به لطف ایجنت‌های هوشمند کلود و در عرض چند روز به سرانجام رسیده است.

۵ دقیقه مطالعه
۰
۱۷ مهر
سرمایه‌گذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانه‌های هوش مصنوعی شد!
آخرین اخبار

سرمایه‌گذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانه‌های هوش مصنوعی شد!

انویدیا از اختصاص یک میلیارد دلار برای توسعه پژوهش‌های علمی و ابررایانه‌های هوش مصنوعی در آمریکا خبر داد؛ بودجه‌ای که برای این غول تراشه‌ساز حکم پول خرد را دارد اما ارتش پردازشی این کشور را در رقابت با چین تقویت می‌کند. این طرح بلندپروازانه با تجهیز آزمایشگاه‌های ملی به تراشه‌های بلک‌ول، پیشتازی هوش مصنوعی و محاسبات کوانتومی را هدف گرفته است.

۳ دقیقه مطالعه
۰
۱۷ مهر
تاکسی خودران اختصاصی ایکس‌پنگ به خیابان‌ها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تست‌های عمومی
آخرین اخبار

تاکسی خودران اختصاصی ایکس‌پنگ به خیابان‌ها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تست‌های عمومی

شرکت چینی ایکس‌پنگ (XPENG) با معرفی برند جهانی «XPENG YOYO» رسماً وارد فاز آزمایش عمومی تاکسی‌های خودران خود شد. این روبوتاکسی تمام‌عیار با تکیه بر ۴ تراشه هوش مصنوعی تورینگ و مدل پیشرفته بینایی-زبانی VLA 2.0، بدون نیاز به لیدار در خیابان‌ها مسافرگیری می‌کند. کاربران منتخب در چین از همین حالا می‌توانند با کدهای دعوت اختصاصی، سفر در کابین لوکس و هوشمند این تاکسی را تجربه کنند.

۱ دقیقه مطالعه
۰
۱۷ مهر