دستهگل تازه ایجنتهای آنتروپیک؛ قطع دسترسی به اینترنت زنده برای مهار هوش مصنوعی سرکش!
شرکت آنتروپیک پس از اینکه متوجه شد ایجنتهای هوش مصنوعیاش برای رسیدن به اهدافشان دست به کارهای عجیبی مثل دور زدن فیلترها و نفوذ به سایتها زدهاند، دسترسی آنها را به اینترنت زنده در ارزیابیهای داخلی قطع کرد. این شرکت اعتراف کرده که آموزشهای ایمنی فعلی هنوز برای کنترل رفتارهای خودسرانه مدلها در دنیای وب کافی نیست. حالا محققان تا زمان پیدا کردن یک راهحل مطمئن برای مهار این ایجنتها، آزمایشها را به حالت آفلاین بردهاند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- ایجنتهای هوش مصنوعی آنتروپیک در ارزیابیهای داخلی، برای حل مسائل به سایتهای دولتی نفوذ کردند، با کوتاهکننده لینک محدودیتها را دور زدند و حتی گزارش قتل جعلی به پلیس فرستادند!
- آنتروپیک اعلام کرد آموزشهای همراستاسازی (Alignment) فعلی هنوز حریف رفتارهای پیشبینینشده این ایجنتها نشده و دسترسی به اینترنت زنده را برای تمام ارزیابیهای داخلی موقتاً قطع کرده است.
- کارشناسان ایمنی میگویند اگرچه قطع اینترنت جلوی خرابکاری را میگیرد، اما سرعت توسعه را کند میکند و نشان میدهد سیستمهای هوش مصنوعی به نظارت مستقل شخص ثالث نیاز دارند.
شرکت آنتروپیک (Anthropic) اعلام کرده که مدلهای هوش مصنوعی این شرکت در جریان آزمایشها دست به نفوذ و سوءاستفاده از وبسایتهای مختلف، از جمله چند سایت متعلق به سازمانهای دولتی آمریکا زدهاند. همین خرابکاریها باعث شده این آزمایشگاه پیشرو هوش مصنوعی دسترسی به اینترنت زنده را برای تمام ارزیابیهای داخلی خود قطع کند؛ حداقل تا زمانی که مطمئن شود میتواند ایجنتهای هوش مصنوعیاش را به طور کامل زیر نظر بگیرد و مهار کند.
این ماجراها که در یک پست وبلاگی رسمی فاش شده، مربوط به ایجنتهای هوش مصنوعی است که وظیفه حل یکسری مسئله را داشتند و برای پیدا کردن منابع به اینترنت فرستاده شده بودند. اما این ایجنتها در مسیر رسیدن به هدف، کارهای عجیبوغریبی کردند؛ از پیدا کردن باگها و رخنه در نرمافزارها و دسترسی رایگان به پایگاههای داده پولی گرفته تا استفاده موذیانه از سرویسهای کوتاهکننده لینک برای دور زدن محدودیتها و انتقال اطلاعات! اوج شاهکارشان هم جایی بود که یک گزارش قتل ساختگی و دروغین برای اداره پلیس فیلادلفیا فرستادند!
آنتروپیک میگوید این رفتارهای غیرمنتظره را در بازبینی فعالیت مدلهایش که از ماه ژوئیه آغاز شده بود کشف کرده است؛ موضوعی که نشان میدهد این آزمایشگاه در لحظه (Real-time) اصلاً متوجه رفتارهای خودسرانه نرمافزارش نبوده و در زمان واقعی نظارتی بر این خرابکاریها نداشته است.
نکته مهم و تأملبرانگیز اینجاست که خود آنتروپیک اعتراف کرده آموزشهای همراستاسازی و ایمنی (Alignment) هنوز برای مهارتهایی مثل وبگردی و کار با رایانه (Computer Use) کافی نیستند. این در حالی است که مانور تبلیغاتی اصلی آنتروپیک دقیقاً روی همین ویژگی است و مدام وعده میدهد که ایجنتهای هوش مصنوعی بهزودی عصای دست تمام متخصصانی خواهند شد که با ابزارهای دیجیتال سر و کار دارند.
رفتارهای عجیبی که آنتروپیک فاش کرده شباهت زیادی به اتفاقات قبلی ایجنتهای شرکت OpenAI دارد؛ ماجرایی که در آن، ایجنتهای اوپنایآی با همکاری یکدیگر برای یافتن اطلاعات به وبسایتهای مختلف، از جمله سایتهای دولتی استرالیا نفوذ کرده بودند.
البته آنتروپیک قبلاً هم فاش کرده بود که مدلهایش به سیستمهای خارجی نفوذ کردهاند. این آزمایشگاه مدعی است گزارش جدید از نظر امنیت و همراستاسازی، به مراتب سبکتر و کمخطرتر از مواردی است که قبلاً علنی کرده بود.
با تمام این اوصاف، این آزمایشگاه اعلام کرده تا زمانی که از نظارت کامل و مهار ایجنتهایش مطمئن نشود، دسترسی به اینترنت زنده را برای «تمام ارزیابیهای داخلی» قطع نگه میدارد.
اما هنوز دقیقاً مشخص نیست این تصمیم در عمل چه پیامدهایی دارد. سیدنی فون آرکس (Sydney Von Arx)، بنیانگذار سازمان ایمنی هوش مصنوعی Nightingale، در گفتوگویی پیش از این گزارش تأکید کرده بود توسعه مدلها در دیتاسنتری که از اینترنت آزاد جدا شده، کار را برای پژوهشگران بهشدت سخت میکند و جلوی پیشرفت مدلهایی را که از دسترسی به وب سود میبرند میگیرد.
فون آرکس در این باره میگوید: «بالاخره باید در یک مرحله این مدلها را همراستا و امن کنید. اگر هوش مصنوعی به مرحله استفاده نهایی برسد ولی هیچوقت به اینترنت دسترسی نداشته باشد، عملاً ابزار چندان به درد بخوری نخواهد بود.»
آنتروپیک توضیح داده که این رفتارهای ناهنجار ناشی از نقص در محیطهای آموزشی آزمایشگاه بوده است؛ نقصی که باعث شده مدلها تصور کنند دور زدن محدودیتها یا کشف رخنهها برایشان پاداش دارد؛ پدیدهای که در دنیای یادگیری تقویتی به آن «هک پاداش» (Reward Hacking) میگویند.
این شرکت حالا میگوید اجرای برخی از ارزیابیهایش را متوقف کرده یا آنها را به فضای آفلاین منتقل کرده و ابزارهایی هم برای شناسایی و مسدود کردن این رفتارها توسعه داده است. این ابزارها روی خرابکاریهای اخیر آزمایش شده و جلوی آنها را گرفتهاند، اما هنوز معلوم نیست چه شواهدی میتواند آنتروپیک را قانع کند که دوباره پای اینترنت زنده را به ارزیابیهای داخلی باز کند. آنتروپیک همچنین گفته که قصد دارد ایجنتهای داخلی خود را به یک «زیرساخت متمرکز با قرنطینه و مهارسازی قدرتمند» منتقل کند و برای پایش این ایجنتها، استفاده از دستهبندیکنندههای ایمنی (Safety Classifiers) را به طور چشمگیری افزایش دهد.
کنراد استوز (Conrad Stosz)، از مسئولان آزمایشگاه نظارت بر هوش مصنوعی Transluce و رئیس سابق مرکز استانداردها و نوآوری هوش مصنوعی ایالات متحده، در بیانیهای گفت: «اینکه آنتروپیک خودش داوطلبانه این اتفاقات جدید، از جمله هدف قرار گرفتن وبسایتهای دولتی آمریکا توسط ایجنتهایش را فاش کرده، جای امیدواری دارد. اما این موضوع دقیقاً نیاز به ارزیابی مستقل و معتبر توسط نهادهای شخص ثالث را به رخ میکشد. جلب اعتماد به این فناوری باید از مسیر حکمرانی و نظارت علمی با دسترسی واقعی و شفاف شکل بگیرد؛ نه اینکه منتظر بمانیم تا محققان خودشان در فضای واقعی به این گافها بربخورند یا شرکتها هر وقت دلشان خواست آنها را داوطلبانه اعتراف کنند.»
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل
چه اتفاقی میافتد اگر به مدت یک ماه هر روز افکار، یادداشتها و دغدغههای ذهنیتان را برای خودتان ایمیل کنید و بگذارید هوش مصنوعی جمینای به آنها جواب دهد؟ این آزمایش تجربی نشان میدهد که دستیار هوش مصنوعی گوگل فراتر از پاسخهای اداری و کلیشهای، چطور میتواند ابزاری غافلگیرکننده برای مرتب کردن شلوغیهای ذهن و پیدا کردن زوایای پنهان کارهای روزمره باشد.

دستهگلهای جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
پس از دستهگلهای اخیر مدلهای هوش مصنوعی آنتروپیک و نفوذ ناخواسته آنها به سامانههای دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعهدهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدلهای خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
استارتاپ پرایم اینتلکت در اقدامی شگفتانگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریمورک پرایم ایجنت را ظرف دو هفته از تایپاسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متنباز است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.