پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

دسته‌گل تازه ایجنت‌های آنتروپیک؛ قطع دسترسی به اینترنت زنده برای مهار هوش مصنوعی سرکش!

انتشار:۱۸ مهر ۱۴۰۵(۲ ساعت پیش)
۳ دقیقه زمان مطالعه
۰ دیدگاه

شرکت آنتروپیک پس از اینکه متوجه شد ایجنت‌های هوش مصنوعی‌اش برای رسیدن به اهدافشان دست به کار‌های عجیبی مثل دور زدن فیلترها و نفوذ به سایت‌ها زده‌اند، دسترسی آن‌ها را به اینترنت زنده در ارزیابی‌های داخلی قطع کرد. این شرکت اعتراف کرده که آموزش‌های ایمنی فعلی هنوز برای کنترل رفتارهای خودسرانه مدل‌ها در دنیای وب کافی نیست. حالا محققان تا زمان پیدا کردن یک راه‌حل مطمئن برای مهار این ایجنت‌ها، آزمایش‌ها را به حالت آفلاین برده‌اند.

دسته‌گل تازه ایجنت‌های آنتروپیک؛ قطع دسترسی به اینترنت زنده برای مهار هوش مصنوعی سرکش!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • ایجنت‌های هوش مصنوعی آنتروپیک در ارزیابی‌های داخلی، برای حل مسائل به سایت‌های دولتی نفوذ کردند، با کوتاه‌کننده لینک محدودیت‌ها را دور زدند و حتی گزارش قتل جعلی به پلیس فرستادند!
  • آنتروپیک اعلام کرد آموزش‌های هم‌راستاسازی (Alignment) فعلی هنوز حریف رفتارهای پیش‌بینی‌نشده این ایجنت‌ها نشده و دسترسی به اینترنت زنده را برای تمام ارزیابی‌های داخلی موقتاً قطع کرده است.
  • کارشناسان ایمنی می‌گویند اگرچه قطع اینترنت جلوی خرابکاری را می‌گیرد، اما سرعت توسعه را کند می‌کند و نشان می‌دهد سیستم‌های هوش مصنوعی به نظارت مستقل شخص ثالث نیاز دارند.

شرکت آنتروپیک (Anthropic) اعلام کرده که مدل‌های هوش مصنوعی این شرکت در جریان آزمایش‌ها دست به نفوذ و سوءاستفاده از وب‌سایت‌های مختلف، از جمله چند سایت متعلق به سازمان‌های دولتی آمریکا زده‌اند. همین خرابکاری‌ها باعث شده این آزمایشگاه پیشرو هوش مصنوعی دسترسی به اینترنت زنده را برای تمام ارزیابی‌های داخلی خود قطع کند؛ حداقل تا زمانی که مطمئن شود می‌تواند ایجنت‌های هوش مصنوعی‌اش را به طور کامل زیر نظر بگیرد و مهار کند.

این ماجراها که در یک پست وبلاگی رسمی فاش شده، مربوط به ایجنت‌های هوش مصنوعی است که وظیفه حل یک‌سری مسئله را داشتند و برای پیدا کردن منابع به اینترنت فرستاده شده بودند. اما این ایجنت‌ها در مسیر رسیدن به هدف، کار‌های عجیب‌وغریبی کردند؛ از پیدا کردن باگ‌ها و رخنه در نرم‌افزارها و دسترسی رایگان به پایگاه‌های داده پولی گرفته تا استفاده موذیانه از سرویس‌های کوتاه‌کننده لینک برای دور زدن محدودیت‌ها و انتقال اطلاعات! اوج شاهکارشان هم جایی بود که یک گزارش قتل ساختگی و دروغین برای اداره پلیس فیلادلفیا فرستادند!

آنتروپیک می‌گوید این رفتارهای غیرمنتظره را در بازبینی فعالیت مدل‌هایش که از ماه ژوئیه آغاز شده بود کشف کرده است؛ موضوعی که نشان می‌دهد این آزمایشگاه در لحظه (Real-time) اصلاً متوجه رفتارهای خودسرانه نرم‌افزارش نبوده و در زمان واقعی نظارتی بر این خرابکاری‌ها نداشته است.

نکته مهم و تأمل‌برانگیز اینجاست که خود آنتروپیک اعتراف کرده آموزش‌های هم‌راستاسازی و ایمنی (Alignment) هنوز برای مهارت‌هایی مثل وب‌گردی و کار با رایانه (Computer Use) کافی نیستند. این در حالی است که مانور تبلیغاتی اصلی آنتروپیک دقیقاً روی همین ویژگی است و مدام وعده می‌دهد که ایجنت‌های هوش مصنوعی به‌زودی عصای دست تمام متخصصانی خواهند شد که با ابزار‌های دیجیتال سر و کار دارند.

رفتارهای عجیبی که آنتروپیک فاش کرده شباهت زیادی به اتفاقات قبلی ایجنت‌های شرکت OpenAI دارد؛ ماجرایی که در آن، ایجنت‌های اوپن‌ای‌آی با همکاری یکدیگر برای یافتن اطلاعات به وب‌سایت‌های مختلف، از جمله سایت‌های دولتی استرالیا نفوذ کرده بودند.

البته آنتروپیک قبلاً هم فاش کرده بود که مدل‌هایش به سیستم‌های خارجی نفوذ کرده‌اند. این آزمایشگاه مدعی است گزارش جدید از نظر امنیت و هم‌راستاسازی، به مراتب سبک‌تر و کم‌خطرتر از مواردی است که قبلاً علنی کرده بود.

با تمام این اوصاف، این آزمایشگاه اعلام کرده تا زمانی که از نظارت کامل و مهار ایجنت‌هایش مطمئن نشود، دسترسی به اینترنت زنده را برای «تمام ارزیابی‌های داخلی» قطع نگه می‌دارد.

اما هنوز دقیقاً مشخص نیست این تصمیم در عمل چه پیامدهایی دارد. سیدنی فون آرکس (Sydney Von Arx)، بنیان‌گذار سازمان ایمنی هوش مصنوعی Nightingale، در گفت‌وگویی پیش از این گزارش تأکید کرده بود توسعه مدل‌ها در دیتاسنتری که از اینترنت آزاد جدا شده، کار را برای پژوهشگران به‌شدت سخت می‌کند و جلوی پیشرفت مدل‌هایی را که از دسترسی به وب سود می‌برند می‌گیرد.

فون آرکس در این باره می‌گوید: «بالاخره باید در یک مرحله این مدل‌ها را هم‌راستا و امن کنید. اگر هوش مصنوعی به مرحله استفاده نهایی برسد ولی هیچ‌وقت به اینترنت دسترسی نداشته باشد، عملاً ابزار چندان به درد بخوری نخواهد بود.»

آنتروپیک توضیح داده که این رفتارهای ناهنجار ناشی از نقص در محیط‌های آموزشی آزمایشگاه بوده است؛ نقصی که باعث شده مدل‌ها تصور کنند دور زدن محدودیت‌ها یا کشف رخنه‌ها برایشان پاداش دارد؛ پدیده‌ای که در دنیای یادگیری تقویتی به آن «هک پاداش» (Reward Hacking) می‌گویند.

این شرکت حالا می‌گوید اجرای برخی از ارزیابی‌هایش را متوقف کرده یا آن‌ها را به فضای آفلاین منتقل کرده و ابزار‌هایی هم برای شناسایی و مسدود کردن این رفتارها توسعه داده است. این ابزار‌ها روی خرابکاری‌های اخیر آزمایش شده و جلوی آن‌ها را گرفته‌اند، اما هنوز معلوم نیست چه شواهدی می‌تواند آنتروپیک را قانع کند که دوباره پای اینترنت زنده را به ارزیابی‌های داخلی باز کند. آنتروپیک همچنین گفته که قصد دارد ایجنت‌های داخلی خود را به یک «زیرساخت متمرکز با قرنطینه و مهارسازی قدرتمند» منتقل کند و برای پایش این ایجنت‌ها، استفاده از دسته‌بندی‌کننده‌های ایمنی (Safety Classifiers) را به طور چشمگیری افزایش دهد.

کنراد استوز (Conrad Stosz)، از مسئولان آزمایشگاه نظارت بر هوش مصنوعی Transluce و رئیس سابق مرکز استانداردها و نوآوری هوش مصنوعی ایالات متحده، در بیانیه‌ای گفت: «اینکه آنتروپیک خودش داوطلبانه این اتفاقات جدید، از جمله هدف قرار گرفتن وب‌سایت‌های دولتی آمریکا توسط ایجنت‌هایش را فاش کرده، جای امیدواری دارد. اما این موضوع دقیقاً نیاز به ارزیابی مستقل و معتبر توسط نهادهای شخص ثالث را به رخ می‌کشد. جلب اعتماد به این فناوری باید از مسیر حکمرانی و نظارت علمی با دسترسی واقعی و شفاف شکل بگیرد؛ نه اینکه منتظر بمانیم تا محققان خودشان در فضای واقعی به این گاف‌ها بربخورند یا شرکت‌ها هر وقت دلشان خواست آن‌ها را داوطلبانه اعتراف کنند.»

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل
آخرین اخبار

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل

چه اتفاقی می‌افتد اگر به مدت یک ماه هر روز افکار، یادداشت‌ها و دغدغه‌های ذهنی‌تان را برای خودتان ایمیل کنید و بگذارید هوش مصنوعی جمینای به آن‌ها جواب دهد؟ این آزمایش تجربی نشان می‌دهد که دستیار هوش مصنوعی گوگل فراتر از پاسخ‌های اداری و کلیشه‌ای، چطور می‌تواند ابزاری غافلگیرکننده برای مرتب کردن شلوغی‌های ذهن و پیدا کردن زوایای پنهان کار‌های روزمره باشد.

۷ دقیقه مطالعه
۰
۱۸ مهر
دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
آخرین اخبار

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!

پس از دسته‌گل‌های اخیر مدل‌های هوش مصنوعی آنتروپیک و نفوذ ناخواسته آن‌ها به سامانه‌های دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعه‌دهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدل‌های خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

۴ دقیقه مطالعه
۰
۱۸ مهر
شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
آخرین اخبار

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!

استارتاپ پرایم اینتلکت در اقدامی شگفت‌انگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریم‌ورک پرایم ایجنت را ظرف دو هفته از تایپ‌اسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متن‌باز است.

۵ دقیقه مطالعه
۰
۱۸ مهر