پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

گزارش OpenAI از موارد جدید اقدامات خودسرانه و غیرمجاز ایجنت‌های هوش مصنوعی

انتشار:۲۸ شهریور ۱۴۰۵(۱ هفته پیش)
۳ دقیقه زمان مطالعه
۰ دیدگاه

شرکت OpenAI نمونه‌های جدیدی از رفتار خارج از کنترل یا «ناهماهنگی مدل» را در ۶ ماه گذشته فاش کرده است؛ از جمله آپلود غیرمجاز فایل‌ها، پیروی از دستورالعمل‌های خودساخته، پنهان‌کردن خطاها و سوءاستفاده از کلیدهای API لو رفته.

گزارش OpenAI از موارد جدید اقدامات خودسرانه و غیرمجاز ایجنت‌های هوش مصنوعی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • شرکت OpenAI چارچوب ساختاریافته جدیدی برای ردیابی، بررسی و افشای اقدامات غیرمجاز ایجنت‌های هوش مصنوعی معرفی کرده است.
  • در ۶ ماه گذشته، رفتارهای نگران‌کننده‌ای مانند جعل داده، پنهان‌کردن خطاها و دور زدن محدودیت‌های شبکه توسط مدل‌هایی نظیر GPT-5.6 Sol ثبت شده است.
  • این افشاگری نشان‌دهنده خطرات امنیتی بالقوه مدل‌های پیشرفته است؛ مواردی که ایجنت‌ها برای تکمیل وظایف خود، فضای ذخیره‌سازی عمومی را به جای محلی انتخاب کرده یا کلیدهای دسترسی را مورد سوءاستفاده قرار داده‌اند.

شرکت OpenAI نمونه‌های جدیدی از آنچه «ناهماهنگی مدل» (Model Misalignment) می‌نامد را از ۶ ماه گذشته ارائه کرده است که شامل آپلود غیرمجاز فایل‌ها، پیروی از دستورالعمل‌های خودساخته، پنهان‌کردن خطاها و سوءاستفاده از کلیدهای API لو رفته می‌شود.

شرکت OpenAI اصطلاح «ناهماهنگی مدل» را برای توصیف مواردی به کار می‌برد که در آن‌ها مدل‌های هوش مصنوعی برخلاف محدودیت‌های تعیین‌شده عمل می‌کنند؛ از جمله انجام اقدامات غیرمجاز، فرار از نظارت، یا دور زدن سازوکارهای ایمنی برای تکمیل یک وظیفه.

بنا بر اعلام این شرکت در گزارشی تازه، OpenAI اکنون از یک چارچوب جدید برای ردیابی و بررسی این اقدامات تاییدنشده توسط ایجنت‌های هوش مصنوعی استفاده می‌کند.

در بیانیه OpenAI آمده است: «ما در حال اشتراک‌گذاری یک چارچوب جدید برای ردیابی، بررسی و افشای موارد ناهماهنگی مدل‌ها در OpenAI هستیم، به همراه ۶ گزارش از رفتارهای غیرمنتظره یا نگران‌کننده مدل‌ها که در ۶ ماه گذشته مشاهده کرده‌ایم.»

نمونه‌های جدید، نخستین مواردی هستند که تحت این چارچوب گزارش‌دهی ساختاریافته‌تر منتشر می‌شوند. این چارچوب قرار است جایگزین رویکرد غیرمنسجم قبلی OpenAI در افشای ناهماهنگی مدل‌ها شود.

شش موردی که OpenAI این بار برجسته کرده است عبارت‌اند از:

  1. یک مدل منتشرنشده دستورالعمل‌های اختصاصی خود را در ۲۷ خلاصه وظیفه وارد کرد که شامل دستوراتی برای نادیده گرفتن محدودیت‌های عادی بود.
  2. نمونه‌هایی از مدل GPT-5.6 Sol دستورالعمل‌های خلاصه‌ای را اضافه کردند که به نمونه‌های بعدی مدل می‌گفت اشتباهات را پنهان کنند، داده‌های تاریخی ناموجود را جعل کنند یا مغایرت‌های نسخه منبع را بپوشانند.
  3. یک مدل بدون مجوز، کلید API لو رفته در سطح عمومی را پیدا و استفاده کرد و سپس زمانی که نتوانست ارقام درخواستی را بازیابی کند، آن‌ها را جعل کرد.
  4. یک مدل منتشرنشده بدون اجازه فایلی را که به صورت محلی تولید شده بود در اینترنت آپلود کرد تا بتواند یک ارجاع قابل دسترسی در مرورگر ارائه دهد.
  5. مدل‌ها از یک مخزن نرم‌افزاری داخلی برای تبادل پیام در بین نمونه‌های آموزشی مجزا استفاده کردند، در حالی که یک مدل قدیمی‌تر در تلاش برای دور زدن محدودیت‌های شبکه، فایل‌های آزمایشی را آپلود کرد.
  6. ایجنت‌های همکار پس از ناتوانی در دسترسی به فایل‌های محلی یکدیگر، فایل‌هایی را در سرویس‌های میزبانی عمومی آپلود کردند. این کار باعث شد با وجود دستورالعمل‌هایی مبنی بر استفاده انحصاری از فضای ذخیره‌سازی محلی، خروجی وظایف از طریق آدرس‌های اینترنتی عمومی در معرض دید قرار گیرد.

هر مورد در یک گزارش رویداد فنی ثبت می‌شود که شامل نام مدل، خلاصه‌ای از رفتار آن در طول حادثه مشاهده‌شده و زمان وقوع رویداد است.

این گزارش همچنین شامل بازسازی دقیق اتفاقات، شامل وظیفه کاربر و استدلال داخلی مدل، تفسیر OpenAI و پیامدهای ایمنی احتمالی و اقداماتی است که برای کاهش خطرات اجرا شده یا خواهند شد.

شرکت OpenAI تاکید کرد که این ۶ مثال نماینده میزان تکرار ناهماهنگی در بین مدل‌های آن نیستند، بلکه نمونه‌های افراطی محسوب می‌شوند که با این وجود نیاز به تحلیل و افشای عمومی داشتند.

بنا بر اعلام این شرکت، تحت فرآیند جدید، هر کارمندی می‌تواند یک رویداد را برای بررسی گزارش دهد.

رویداد مورد نظر ارزیابی شده و بسته به پیچیدگی، دخالت شخص ثالث، نقص‌های امنیتی و خطرات سوءاستفاده، در سه دسته «آماده افشا»، «بررسی جزئی» یا «بررسی گسترده» قرار می‌گیرد.

شش نمونه ارائه‌شده در این گزارش در دو دسته اول جای می‌گیرند، در حالی که دسته سوم تا پایان تحقیقات و انتشار یک کالبدشکافی دقیق‌تر، تنها یک گزارش اولیه دریافت می‌کند.

شرکت OpenAI می‌گوید نفوذ پلتفرم Hugging Face در اوایل سال جاری میلادی که در آن دسته‌ای متشکل از ۷۰۰ ایجنت هوش مصنوعی «ناهماهنگ» درگیر بودند، در آن دسته سوم از نظر شدت قرار می‌گیرد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر