نقشه مشترک OpenAI و آنتروپیک برای مهار هوش مصنوعی سرکش؛ اما یک گیر اساسی وجود دارد!
پس از ماجرای جنجالی نفوذ ناخواسته ایجنتهای هوش مصنوعی OpenAI و آنتروپیک به پلتفرمهای بیرونی، این دو شرکت تصمیم گرفتهاند پای ناظران مستقل را به عنوان ارزیاب مقیم به داخل آزمایشگاههای خود باز کنند. با این حال، داوطلبانه بودن این بازرسیها باعث شده کنترل سطح دسترسی و انتشار عمومی نتایج همچنان در دست خود غولهای فناوری باقی بماند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- ایجنتهای داخلی OpenAI و مدلهای کلود حین آزمونهای امنیتی رفتارهای خودسرانه نشان داده و حتی به سیستمهای واقعی و پلتفرم Hugging Face نفوذ کردهاند!
- غولهای هوش مصنوعی متعهد شدهاند کارشناسان بیرونی موسوم به «ارزیابهای مقیم» را برای نظارت مستقیم بر توسعه مدلها به داخل آزمایشگاههای خود راه دهند.
- نکته کلیدی و چالشبرانگیز ماجرا اینجاست که این نظارتها کاملاً داوطلبانه است و شرکتها هنوز کنترل کاملی روی دامنه دسترسیها و انتشار عمومی یافتهها دارند.
ماجرا از جایی شروع شد که ایجنتهای هوش مصنوعی داخلی OpenAI حین دور زدن یک بنچمارک امنیت سایبری، دستهگل به آب دادند و به پلتفرم هاگینگ فیس نفوذ کردند. از طرف دیگر، شرکت آنتروپیک هم رسماً فاش کرد که مدلهای کلود (Claude) از محیطهای تستی و قرنطینهشده فرار کرده، به اینترنت باز دسترسی پیدا کرده و وارد سیستمهای واقعی سازمانهای بیرونی شدهاند.
هر دو مورد نمونههای بارزی از رفتارهای خودسرانه سیستمها هستند؛ اقداماتی که سازندگانشان ابداً قصد انجامش را نداشتند. همین حواشی، پای سازمان غیرانتفاعی و مستقل METR را به میدان باز کرد تا قضیه را موشکافی کند. این سازمان ابتدا با همکاری Redwood Research گزارش ماجرای نفوذ به هاگینگ فیس را مستند کرد و حالا مشغول بررسی خطاهای رفتاری مدلهای آنتروپیک است.
به گزارش نشریه آتلانتیک، OpenAI و آنتروپیک متعهد شدهاند که پای کارشناسان زبده بیرونی را به داخل شرکتهای خود باز کنند تا شیوههای ایمنی را از نزدیک ارزیابی کنند. این پژوهشگران که تحت عنوان «ارزیابهای مقیم» شناخته میشوند، قرار است روند آموزش و معماری مدلها را زیر ذرهبین ببرند و به سراغ باگها و خطراتی بروند که شاید هرگز در دموی عمومی محصولات به چشم نیایند.
اما گیر اصلی کار اینجاست که این نظارتها کاملاً داوطلبانه است! هرچند هفته گذشته مدیران ارشد آنتروپیک، OpenAI و چند آزمایشگاه بزرگ دیگر در کاخ سفید توافقنامهای امضا کردند تا به حسابرسان مستقل بیرونی متعهد شوند، و با وجود اینکه کمیسیون فدرال تجارت (FTC) تحقیقات گستردهای را آغاز کرده، اما غولهای هوش مصنوعی هنوز کنترل همهچیز را در دست دارند؛ آنها مشخص میکنند کارشناسان چه بخشهایی را ببینند، چه ریسکهایی را بررسی کنند و اصلاً چه اطلاعاتی به گوش مردم برسد.
برای کاربری که این روزها مدام تشویق میشود کارهایش را به هوش مصنوعی بسپارد، این وضعیت یک چالش اساسی در جلب اعتماد ایجاد میکند؛ ما در حال تحویل گرفتن دستیارهایی همهفنحریف هستیم، در حالی که سیستمهای نظارت مستقل بر رفتار آنها هنوز در مراحل ابتدایی شکلگیری هستند.
جالب است بدانید طبق آماری که در مستند «The AI Doc» مطرح شده، بیش از ۲۰ هزار نفر شبانهروز روی توسعه هوش مصنوعی جامع (AGI) کار میکنند، در حالی که کمتر از ۲۰۰ نفر به طور تخصصی روی مقوله حیاتی ایمنی هوش مصنوعی متمرکز هستند!
نگاهی از درون به قلب غولهای هوش مصنوعی

در حال حاضر، محققان بیرونی صرفاً مدل را پیش از عرضه عمومی آزمایش کرده و گزارشی از عملکرد آن ارائه میدهند. اما مستقر شدن ارزیابها در داخل شرکتها به آنها اجازه میدهد کل فرایند توسعه را دنبال کنند و دلایل و تصمیمات پشت هر رفتار مدل را زیر نظر بگیرند.
آنتروپیک میگوید این بازرسان دسترسیهایی مشابه کارمندان داخلی خواهند داشت؛ یعنی میتوانند فرایند آموزش را مشاهده کنند، با مهندسان گفتگو کنند و سازوکار توسعه و استقرار مدلها را موشکافی کنند.
این شرکت، کمپانی اکسنتور (Accenture) را به عنوان نخستین ارزیاب مقیم خود معرفی کرده که با هدایت بخش تخصصی هوش مصنوعیاش یعنی Faculty کار را جلو خواهد برد. طبق برآوردها، هر دو کمپانی قصد دارند حداقل یک میلیارد دلار طی پنج سال آینده روی ایمنی هوش مصنوعی سرمایهگذاری کنند.
چنین دسترسی عمیقی میتواند مشخص کند که آیا یک خطای نگرانکننده صرفاً یک اتفاق تصادفی بوده یا نشانهای از یک باگ ساختاری عمیقتر است. رویکرد پیشنهادی METR برای بررسی چنین حوادثی شامل بازخوانی لاگها، مصاحبه با کارمندان و بررسی دقیق شرایط تمرینی مدل است که ممکن است به رفتارهای سرکش دامن زده باشد.
اما تعیین قوانین بازی هنوز دست خود شرکتهاست!

آنتروپیک خودش هم اذعان دارد که هنوز استانداردهای مشخصی برای سطح دسترسی، نحوه گزارشدهی و بودجه این ارزیابها تعیین نشده است. جالب اینجاست که آنتروپیک هزینه کار اکسنتور را مستقیماً از جیب خود پرداخت میکند، در حالی که به موازات آن مشغول مذاکره با نهادهای غیرانتفاعی است تا با بودجه شخصی خودشان پروژههای آزمایشی را اجرا کنند.
البته اکسنتور هم غریبه نیست؛ این دو شرکت پیش از این هم بر اساس شراکت تجاری دسامبر ۲۰۲۵، یک گروه تجاری مشترک را اداره میکردند.
همین پیوند تجاری حسابی جای بحث دارد؛ به طوری که جمعی از متخصصان با انتشار نامهای سرگشاده هشدار دادند ارزیابهای مستقر نباید هیچگونه رابطه تجاری یا منفعت مالی عمدهای با آزمایشگاههایی که ارزیابیشان میکنند داشته باشند تا استقلالشان مخدوش نشود.
همانطور که گزارش آتلانتیک توضیح میدهد، نظارت داوطلبانه اختیارات بیپایانی به شرکتها میدهد تا دامنه بازرسیها را محدود کنند. محققان باید آزادی عمل کافی داشته باشند تا حتی ناخوشایندترین مدارک را افشا کنند و یافتههای واقعیشان را به اطلاع عموم برسانند.
علاوه بر این، ناظران باید بتوانند بدون ترس توضیح دهند دسترسی به چه بخشهایی از آنها سلب شده است. شفافیت اصل ماجراست؛ چراکه گزارشی که با دسترسی گزینشی تهیه شده باشد شاید ارزشمند به نظر برسد، اما باید مشخص باشد که دست ارزیاب تا کجا باز بوده و مرز نتایجش کجاست.
این ماجرا چه معنایی برای کاربران چتجیپیتی و کلود دارد؟
برای درک بهتر موضوع، بد نیست بدانید ارزیابی اخیر سازمان METR روی مدل Claude Opus 5.5 عمدتاً روی این متمرکز بود که آیا این مدل میتواند به تحقیق و توسعه هوش مصنوعی شتاب ببخشد یا خیر. جالب اینکه METR صراحتاً اعلام کرد این خلاصه، اصلاً انطباق رفتاری مدل و پایبندیاش به چارچوبهای ایمنی را بررسی نکرده است!
این ارزیابی بدون دریافت دستمزد انجام شد، اما METR شفافسازی کرد که آنتروپیک حق بازبینی و ویرایش متن گزارش را پیش از انتشار نهایی داشته است.
البته طغیان ایجنتهای داخلی لزوماً به این معنی نیست که چتجیپیتی یا کلودی که روزانه با آن کار میکنید هم رفتارهای مشابهی نشان دهند. آزمایشهای OpenAI نشان داده تمایل ایجنتها به دستکاری یا آسیب به زیرساختها در نسخه نهایی ChatGPT بیش از ۱۰۰ برابر کمتر از محیطهای آزمایشی است، و آنتروپیک هم تأکید دارد چنین رفتارهایی بعید است در کاربردهای روزمره رخ دهند.
با این حال، پژوهشگران مستقل به دسترسی کافی برای کشف خطرات و آزادی کامل برای انتشار نتایج نیاز دارند؛ حتی اگر این کار باعث تأخیر در عرضه یک محصول شود یا مایه شرمساری شرکتی باشد که دستمزدشان را پرداخته است!
ورود ارزیابهای خارجی به آزمایشگاههای هوش مصنوعی گامی امیدوارکننده است، اما میزان تأثیرگذاری آنها به این بستگی دارد که وقتی به یک چالش یا خطر جدی برخورد کردند چه رخ خواهد داد. اگر شرکتها بتوانند دامنه تحقیقات را ببندند یا نتایج را بایگانی کنند، جامعه باز هم چارهای جز اعتماد چشمبسته به ادعاهای خود این شرکتها نخواهد داشت.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

افشای اسناد جنجالی عرضه اولیه آنتروپیک؛ آیا هشدارهای آخرالزمانی سرپوشی برای زیانهای نجومی است؟
اسناد لورفته از برنامه عرضه عمومی آنتروپیک نشان میدهد این غول هوش مصنوعی با وجود زیانهای میلیاردی و هزینههای نجومی پردازش ابری، بخش بزرگی از پرونده خود را به هشدارهای آخرالزمانی اختصاص داده است. کارشناسان معتقدند بزرگنمایی خطر نابودی جهان ترفندی زیرکانه از سوی مدیران این شرکت برای فرار از پاسخگویی و جلب ارزشگذاریهای حبابی در بازار بورس است.

تب داغ مدل Jev؛ بازگشت شکوهمند هوش مصنوعی پیشبین به میدان رقابت!
موج تازهای از مدلهای تصمیمگیری نظیر Jev، هوش مصنوعی پیشبین را پس از سالها حاشیهنشینی دوباره به کانون توجه کشاندهاند. با این حال، کارشناسان هشدار میدهند که بدون پیوند دادن اهداف کسبوکار با سنجههای فنی، این فناوری نوپا نیز در فاز عملیاتی به سرنوشت پروژههای ناموفق گذشته دچار خواهد شد.

چرا ریلزهایتان نگرفت؟ دستیار هوش مصنوعی جدید اینستاگرام دلیل شکست ویدیوها را فاش میکند!
متا از دستیار هوش مصنوعی جدیدی با نام Edits Assistant در اپلیکیشن ویرایش اینستاگرام رونمایی کرد که دقیقاً به تولیدکنندگان محتوا توضیح میدهد چرا یک ریلز وایرال شده و دیگری با شکست مواجه شده است. این ابزار با تحلیل دادههای تعاملی، ایدههایی کاربردی از قلابهای جذاب گرفته تا موزیکهای ترند را برای بهبود عملکرد پیج پیشنهاد میکند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.