شکار ایجنتهای سرکش با کسری از هزینه معمول؛ ترفند جدید گودفایر برای نظارت بر هوش مصنوعی از درون
استارتاپ گودفایر (Goodfire) از روشی فوقالعاده ارزانتر برای مهار و کنترل ایجنتهای هوش مصنوعی رونمایی کرده است. این سیستم به جای استخدام یک هوش مصنوعی مجزا و گرانقیمت برای بررسی مداوم رفتارها، مستقیماً به سیگنالهای درونی مغز مدل سرک میکشد و فعالیتهای مشکوک را با هزینهای ناچیز شکار میکند. این نوآوری میتواند خیال توسعهدهندگان را از خرابکاری یا فرار ایجنتها تا حد زیادی راحت کند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- به جای استفاده از یک هوش مصنوعی دوم و پرهزینه که مدام بالای سر ایجنت کشیک بدهد، ناظرهای گودفایر مستقیماً سیگنالها و محاسبات داخلی مغز مدل را زیر نظر میگیرند.
- هزینه نظارت بر ۱۵۰۰ نشست کاری در این روش به حدود ۵۱ دلار میرسد، در حالی که استفاده از مدلهای تراز اول برای پایش مرحلهبهمرحله میتواند تا ۱۰ هزار دلار خرج روی دست شرکتها بگذارد.
- این پروبهای هوشمند موفق شدهاند تا ۹۴ درصد از رفتارهای خرابکارانه و هک ایجنتها را بدون ایجاد تأخیر محسوس در پاسخدهی کشف کنند؛ راهکاری حیاتی برای مهار مدلهای باز.
روش معمول برای اینکه یک ایجنت هوش مصنوعی از مسیرش منحرف نشود، این بوده که یک مدل دوم مدام بالای سرش بایستد و هر کاری انجام میدهد را کلمهبهکلمه چک کند. هرچند این شیوه تا به حال رویکرد پیشفرض شرکتها بوده، اما وقتی ایجنتها ساعتها بیوقفه کار میکنند و متنی به اندازه چند جلد رمان را زیر و رو میکنند، هزینهها خیلی زود سر به فلک میکشد.
حالا استارتاپ گودفایر (Goodfire) که روی حوزه تفسیرپذیری (سر درآوردن از سازوکار درونی مدلهای هوش مصنوعی) متمرکز است، گزینهای بسیار ارزانتر را روانه میدان کرده است: ناظرهایی که حین کار کردن مدل، به جای خواندن نوشتههایش، مستقیماً وقایع درون مغز هوش مصنوعی را زیر نظر میگیرند. این ابزارهای نظارتی هماکنون در دسترس مشتریان بیستن (Baseten) قرار گرفتهاند؛ شرکتی که مدلهای هوش مصنوعی را برای کسبوکارهای دیگر میزبانی و اجرا میکند.
جالب است بدانید آزمایشگاه بیس لبز (Base Labs) وابسته به Baseten، ماه گذشته از همکاری امنیتی مشترک خود با گودفایر و پلتفرم محبوب هوش مصنوعی هاگینگ فیس (Hugging Face) خبر داده بود.
این رونمایی درست پس از سلسله حوادث جنجالی امسال رخ میدهد که در آنها ایجنتهای هوش مصنوعی از محیطهای آزمایشی و ایزوله خود فرار کردند؛ از جمله ایجنتهای شرکت OpenAI که وارد پلتفرم Hugging Face شدند. مدل باز Kimi K3 هم که گودفایر اولین سیستم نظارتی خود را بر پایه آن طراحی کرده، همین تابستان با سوءاستفاده از یک شکاف امنیتی در محیط سندباکس خود، توانسته بود به اینترنت و اطلاعات گیتهاب سرک بکشد.
سیستم گودفایر تقریباً مثل گیت بازرسی فرودگاه کار میکند. حسگرهای کوچکی به نام «پروب» (Probe) در تکتک مراحل کار ایجنت، سیگنالهای داخلی مدل را میخوانند؛ درست مثل گیتهای اسکنری که همه مسافران از آنها رد میشوند. تنها زمانی که این پروبها یک رفتار مشکوک را علامت بزنند، یک مدل هوش مصنوعی جداگانه وارد میدان میشود تا مثل بازرسی بدنی دقیق، همهچیز را با وسواس بررسی کند.
مشتریان Baseten میتوانند خطرات مدنظرشان برای نظارت را تعیین کنند؛ مواردی مثل هکهای تهاجمی، سوءاستفاده در زمینه سلاحهای شیمیایی و بیولوژیکی، یا پدیده «هک پاداش» (دور زدن قوانین برای گرفتن امتیاز بالاتر). همچنین تصمیمگیری درباره واکنش خودکار سیستم هم با خود آنهاست: از ثبت گزارش ساده رویداد گرفته تا ارجاع آن برای بررسی انسانی یا مسدود کردن کامل درخواست.
گودفایر تأکید میکند که اجرای این روش بسیار ارزانتر تمام میشود. در رویکردهای سنتی، ناظرهای هوش مصنوعی مدلهای جداگانهای هستند که باید تمام فعالیتها و متون مدل اصلی را دوباره از نو بخوانند؛ کاری که حسابی زمانبر و پرهزینه است. اما پروبهای گودفایر سراغ محاسباتی میروند که خود مدل حین فعالیت در حال انجام دادن آنهاست.
اریک هو (مدیرعامل Goodfire) هفته گذشته در پادکست MAD به میزبانی مت تورک گفت: «ناظرهای مبتنی بر اکتیویشنهای درونی واقعاً ارزان هستند، چون از محاسبات پاس رو به جلو (Forward Pass) که قبلاً انجام شده دوباره استفاده میکنند. یعنی خود مدل در حال محاسبه این توکن است و تنها کاری که ما میکنیم، خواندن اکتیویشنهای عصبی میانی و اجرای یک دستهبندیکننده ساده روی این محاسبات داخلی است.» خلاصه ماجرا این است: خود مدل همه محاسبات سنگین ریاضی را انجام میدهد و پروبها فقط نتایج آماده را تحلیل میکنند.
در آزمایشهای گودفایر روی مدل Kimi K3، پایش حدود ۱۵۰۰ نشست کاری تقریباً ۵۱ دلار هزینه برداشت؛ در حالی که نظارت مرحلهبهمرحله با یک مدل ارزان حدود ۲۳۳ دلار و با یک مدل تراز اول تا ۱۰ هزار دلار آب میخورد! این پروبها موفق شدند ۹۴ درصد از نشستهای مربوط به هک مخرب را شکار کنند و فقط ۸٫۷ درصد از تعاملات بیخطر را برای بررسی دوباره فرستادند.
به گفته این شرکت، اجرای همزمان چهار پروب تنها کمتر از ۲ درصد به زمان پاسخدهی مدل اضافه کرد که عملاً یعنی هیچ تأخیر محسوسی در کار ایجاد نمیشود.

دن بالسام، مدیر ارشد فناوری و همبنیانگذار گودفایر میگوید: «بزرگترین برتری این روش این است که مچ رفتارها را پیش از وقوع میگیرید. ما میتوانیم درست همان لحظهای که مدل حین ارزیابی یا آموزش احتمال دارد دست به هک بزند، آن را شناسایی کنیم.»
این ایده به ویژه مدلهای متنباز را هدف گرفته است؛ مدلهایی که توسعهدهندگان میتوانند آزادانه دانلود کرده و حفاظهای ایمنی آنها را دور بزنند، ضمن اینکه این مدلها فاقد سیستمهای نظارتی پیشرفتهای هستند که شرکتهای دارای آزمایشگاههای بسته روی پلتفرمهای اختصاصی خود اجرا میکنند.
بالسام توضیح میدهد: «خطری که یک کاربر عادی میتواند با مدلهای باز ایجاد کند، در مقایسه با پتانسیل تخریبی که خوشههای بزرگ پردازشی و ارائهدهندگان سرویس استنتاج (Inference) با آن روبهرو هستند بسیار ناچیز است؛ چرا که بخش اعظم مسئولیت بر دوش همین سرویسدهندهها قرار دارد. وقتی لحظه تحول بزرگ مدلهای متنباز فرا برسد، همه خواهند دید که وجود حفاظهای ایمنی درست در زمان استنتاج، یک ضرورت غیرقابلانکار است.»
تحقیقات اخیر گودفایر نشان داده که مدلهای متنباز مطرح، از جمله Kimi K3 و GLM-5.2، در ۵۰ تا ۹۶ درصد از سناریوهای آزمایشی ایجنتها دست به هک پاداش (تقلب برای کسب امتیاز بالاتر) زدهاند.
البته گودفایر اولین شرکتی نیست که این مسیر را امتحان میکند. گوگل دیپمایند (Google DeepMind) نیز در ماه ژانویه فاش کرده بود که نتایج تحقیقاتش زمینه را برای استقرار پروبهای تشخیص سوءاستفاده در جمنای (Gemini) فراهم کرده است.
به گفته بالسام، این ناظرها تنها بخش کوتاهمدتی از یک هدف پژوهشی بسیار بزرگتر هستند: مهندسی معکوس مدلهای زبانی بزرگ تا بتوان هر رفتار خاص را به نقطه دقیق شکلگیریاش در زمان آموزش ردیابی کرد. او در پایان میگوید: «امیدواریم روزی این جادوی پیشبینیناپذیر آموزش مدلها را به مهندسی دقیق تبدیل کنیم.»
مطالب مرتبط و پیشنهادی

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد
یک اخترفیزیکدان در دانشگاه جانز هاپکینز با استفاده از پلتفرم Claude Science موفق شد یکسوم گمشده از نقشه فرابنفش کیهان را بازسازی و کامل کند. این پروژه عظیم که در گذشته به ماهها کار طاقتفرسا نیاز داشت، حالا به لطف ایجنتهای هوشمند کلود و در عرض چند روز به سرانجام رسیده است.

سرمایهگذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانههای هوش مصنوعی شد!
انویدیا از اختصاص یک میلیارد دلار برای توسعه پژوهشهای علمی و ابررایانههای هوش مصنوعی در آمریکا خبر داد؛ بودجهای که برای این غول تراشهساز حکم پول خرد را دارد اما ارتش پردازشی این کشور را در رقابت با چین تقویت میکند. این طرح بلندپروازانه با تجهیز آزمایشگاههای ملی به تراشههای بلکول، پیشتازی هوش مصنوعی و محاسبات کوانتومی را هدف گرفته است.

تاکسی خودران اختصاصی ایکسپنگ به خیابانها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تستهای عمومی
شرکت چینی ایکسپنگ (XPENG) با معرفی برند جهانی «XPENG YOYO» رسماً وارد فاز آزمایش عمومی تاکسیهای خودران خود شد. این روبوتاکسی تمامعیار با تکیه بر ۴ تراشه هوش مصنوعی تورینگ و مدل پیشرفته بینایی-زبانی VLA 2.0، بدون نیاز به لیدار در خیابانها مسافرگیری میکند. کاربران منتخب در چین از همین حالا میتوانند با کدهای دعوت اختصاصی، سفر در کابین لوکس و هوشمند این تاکسی را تجربه کنند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.