پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

نقشه مشترک OpenAI و آنتروپیک برای مهار هوش مصنوعی سرکش؛ اما یک گیر اساسی وجود دارد!

انتشار:۱۳ مهر ۱۴۰۵(۴۶ دقیقه پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

پس از ماجرای جنجالی نفوذ ناخواسته ایجنت‌های هوش مصنوعی OpenAI و آنتروپیک به پلتفرم‌های بیرونی، این دو شرکت تصمیم گرفته‌اند پای ناظران مستقل را به عنوان ارزیاب مقیم به داخل آزمایشگاه‌های خود باز کنند. با این حال، داوطلبانه بودن این بازرسی‌ها باعث شده کنترل سطح دسترسی و انتشار عمومی نتایج همچنان در دست خود غول‌های فناوری باقی بماند.

نقشه مشترک OpenAI و آنتروپیک برای مهار هوش مصنوعی سرکش؛ اما یک گیر اساسی وجود دارد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • ایجنت‌های داخلی OpenAI و مدل‌های کلود حین آزمون‌های امنیتی رفتارهای خودسرانه نشان داده و حتی به سیستم‌های واقعی و پلتفرم Hugging Face نفوذ کرده‌اند!
  • غول‌های هوش مصنوعی متعهد شده‌اند کارشناسان بیرونی موسوم به «ارزیاب‌های مقیم» را برای نظارت مستقیم بر توسعه مدل‌ها به داخل آزمایشگاه‌های خود راه دهند.
  • نکته کلیدی و چالش‌برانگیز ماجرا اینجاست که این نظارت‌ها کاملاً داوطلبانه است و شرکت‌ها هنوز کنترل کاملی روی دامنه دسترسی‌ها و انتشار عمومی یافته‌ها دارند.

ماجرا از جایی شروع شد که ایجنت‌های هوش مصنوعی داخلی OpenAI حین دور زدن یک بنچمارک امنیت سایبری، دسته‌گل به آب دادند و به پلتفرم هاگینگ فیس نفوذ کردند. از طرف دیگر، شرکت آنتروپیک هم رسماً فاش کرد که مدل‌های کلود (Claude) از محیط‌های تستی و قرنطینه‌شده فرار کرده، به اینترنت باز دسترسی پیدا کرده و وارد سیستم‌های واقعی سازمان‌های بیرونی شده‌اند.

هر دو مورد نمونه‌های بارزی از رفتارهای خودسرانه سیستم‌ها هستند؛ اقداماتی که سازندگانشان ابداً قصد انجامش را نداشتند. همین حواشی، پای سازمان غیرانتفاعی و مستقل METR را به میدان باز کرد تا قضیه را موشکافی کند. این سازمان ابتدا با همکاری Redwood Research گزارش ماجرای نفوذ به هاگینگ فیس را مستند کرد و حالا مشغول بررسی خطاهای رفتاری مدل‌های آنتروپیک است.

به گزارش نشریه آتلانتیک، OpenAI و آنتروپیک متعهد شده‌اند که پای کارشناسان زبده بیرونی را به داخل شرکت‌های خود باز کنند تا شیوه‌های ایمنی را از نزدیک ارزیابی کنند. این پژوهشگران که تحت عنوان «ارزیاب‌های مقیم» شناخته می‌شوند، قرار است روند آموزش و معماری مدل‌ها را زیر ذره‌بین ببرند و به سراغ باگ‌ها و خطراتی بروند که شاید هرگز در دموی عمومی محصولات به چشم نیایند.

اما گیر اصلی کار اینجاست که این نظارت‌ها کاملاً داوطلبانه است! هرچند هفته گذشته مدیران ارشد آنتروپیک، OpenAI و چند آزمایشگاه بزرگ دیگر در کاخ سفید توافق‌نامه‌ای امضا کردند تا به حسابرسان مستقل بیرونی متعهد شوند، و با وجود این‌که کمیسیون فدرال تجارت (FTC) تحقیقات گسترده‌ای را آغاز کرده، اما غول‌های هوش مصنوعی هنوز کنترل همه‌چیز را در دست دارند؛ آن‌ها مشخص می‌کنند کارشناسان چه بخش‌هایی را ببینند، چه ریسک‌هایی را بررسی کنند و اصلاً چه اطلاعاتی به گوش مردم برسد.

برای کاربری که این روز‌ها مدام تشویق می‌شود کارهایش را به هوش مصنوعی بسپارد، این وضعیت یک چالش اساسی در جلب اعتماد ایجاد می‌کند؛ ما در حال تحویل گرفتن دستیارهایی همه‌فن‌حریف هستیم، در حالی که سیستم‌های نظارت مستقل بر رفتار آن‌ها هنوز در مراحل ابتدایی شکل‌گیری هستند.

جالب است بدانید طبق آماری که در مستند «The AI Doc» مطرح شده، بیش از ۲۰ هزار نفر شبانه‌روز روی توسعه هوش مصنوعی جامع (AGI) کار می‌کنند، در حالی که کم‌تر از ۲۰۰ نفر به طور تخصصی روی مقوله حیاتی ایمنی هوش مصنوعی متمرکز هستند!

نگاهی از درون به قلب غول‌های هوش مصنوعی

آنتروپیک
(منبع تصویر: Shutterstock)

در حال حاضر، محققان بیرونی صرفاً مدل را پیش از عرضه عمومی آزمایش کرده و گزارشی از عملکرد آن ارائه می‌دهند. اما مستقر شدن ارزیاب‌ها در داخل شرکت‌ها به آن‌ها اجازه می‌دهد کل فرایند توسعه را دنبال کنند و دلایل و تصمیمات پشت هر رفتار مدل را زیر نظر بگیرند.

آنتروپیک می‌گوید این بازرسان دسترسی‌هایی مشابه کارمندان داخلی خواهند داشت؛ یعنی می‌توانند فرایند آموزش را مشاهده کنند، با مهندسان گفتگو کنند و سازوکار توسعه و استقرار مدل‌ها را موشکافی کنند.

این شرکت، کمپانی اکسنتور (Accenture) را به عنوان نخستین ارزیاب مقیم خود معرفی کرده که با هدایت بخش تخصصی هوش مصنوعی‌اش یعنی Faculty کار را جلو خواهد برد. طبق برآوردها، هر دو کمپانی قصد دارند حداقل یک میلیارد دلار طی پنج سال آینده روی ایمنی هوش مصنوعی سرمایه‌گذاری کنند.

چنین دسترسی عمیقی می‌تواند مشخص کند که آیا یک خطای نگران‌کننده صرفاً یک اتفاق تصادفی بوده یا نشانه‌ای از یک باگ ساختاری عمیق‌تر است. رویکرد پیشنهادی METR برای بررسی چنین حوادثی شامل بازخوانی لاگ‌ها، مصاحبه با کارمندان و بررسی دقیق شرایط تمرینی مدل است که ممکن است به رفتارهای سرکش دامن زده باشد.

اما تعیین قوانین بازی هنوز دست خود شرکت‌هاست!

سام آلتمن
(منبع تصویر: Getty Images)

آنتروپیک خودش هم اذعان دارد که هنوز استانداردهای مشخصی برای سطح دسترسی، نحوه گزارش‌دهی و بودجه این ارزیاب‌ها تعیین نشده است. جالب اینجاست که آنتروپیک هزینه کار اکسنتور را مستقیماً از جیب خود پرداخت می‌کند، در حالی که به موازات آن مشغول مذاکره با نهادهای غیرانتفاعی است تا با بودجه شخصی خودشان پروژه‌های آزمایشی را اجرا کنند.

البته اکسنتور هم غریبه نیست؛ این دو شرکت پیش از این هم بر اساس شراکت تجاری دسامبر ۲۰۲۵، یک گروه تجاری مشترک را اداره می‌کردند.

همین پیوند تجاری حسابی جای بحث دارد؛ به طوری که جمعی از متخصصان با انتشار نامه‌ای سرگشاده هشدار دادند ارزیاب‌های مستقر نباید هیچ‌گونه رابطه تجاری یا منفعت مالی عمده‌ای با آزمایشگاه‌هایی که ارزیابی‌شان می‌کنند داشته باشند تا استقلالشان مخدوش نشود.

همان‌طور که گزارش آتلانتیک توضیح می‌دهد، نظارت داوطلبانه اختیارات بی‌پایانی به شرکت‌ها می‌دهد تا دامنه بازرسی‌ها را محدود کنند. محققان باید آزادی عمل کافی داشته باشند تا حتی ناخوشایندترین مدارک را افشا کنند و یافته‌های واقعی‌شان را به اطلاع عموم برسانند.

علاوه بر این، ناظران باید بتوانند بدون ترس توضیح دهند دسترسی به چه بخش‌هایی از آن‌ها سلب شده است. شفافیت اصل ماجراست؛ چراکه گزارشی که با دسترسی گزینشی تهیه شده باشد شاید ارزشمند به نظر برسد، اما باید مشخص باشد که دست ارزیاب تا کجا باز بوده و مرز نتایجش کجاست.

این ماجرا چه معنایی برای کاربران چت‌جی‌پی‌تی و کلود دارد؟

برای درک بهتر موضوع، بد نیست بدانید ارزیابی اخیر سازمان METR روی مدل Claude Opus 5.5 عمدتاً روی این متمرکز بود که آیا این مدل می‌تواند به تحقیق و توسعه هوش مصنوعی شتاب ببخشد یا خیر. جالب اینکه METR صراحتاً اعلام کرد این خلاصه، اصلاً انطباق رفتاری مدل و پایبندی‌اش به چارچوب‌های ایمنی را بررسی نکرده است!

این ارزیابی بدون دریافت دستمزد انجام شد، اما METR شفاف‌سازی کرد که آنتروپیک حق بازبینی و ویرایش متن گزارش را پیش از انتشار نهایی داشته است.

البته طغیان ایجنت‌های داخلی لزوماً به این معنی نیست که چت‌جی‌پی‌تی یا کلودی که روزانه با آن کار می‌کنید هم رفتارهای مشابهی نشان دهند. آزمایش‌های OpenAI نشان داده تمایل ایجنت‌ها به دست‌کاری یا آسیب به زیرساخت‌ها در نسخه نهایی ChatGPT بیش از ۱۰۰ برابر کم‌تر از محیط‌های آزمایشی است، و آنتروپیک هم تأکید دارد چنین رفتارهایی بعید است در کاربردهای روزمره رخ دهند.

با این حال، پژوهشگران مستقل به دسترسی کافی برای کشف خطرات و آزادی کامل برای انتشار نتایج نیاز دارند؛ حتی اگر این کار باعث تأخیر در عرضه یک محصول شود یا مایه شرمساری شرکتی باشد که دستمزدشان را پرداخته است!

ورود ارزیاب‌های خارجی به آزمایشگاه‌های هوش مصنوعی گامی امیدوارکننده است، اما میزان تأثیرگذاری آن‌ها به این بستگی دارد که وقتی به یک چالش یا خطر جدی برخورد کردند چه رخ خواهد داد. اگر شرکت‌ها بتوانند دامنه تحقیقات را ببندند یا نتایج را بایگانی کنند، جامعه باز هم چاره‌ای جز اعتماد چشم‌بسته به ادعاهای خود این شرکت‌ها نخواهد داشت.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

افشای اسناد جنجالی عرضه اولیه آنتروپیک؛ آیا هشدارهای آخرالزمانی سرپوشی برای زیان‌های نجومی است؟
آخرین اخبار

افشای اسناد جنجالی عرضه اولیه آنتروپیک؛ آیا هشدارهای آخرالزمانی سرپوشی برای زیان‌های نجومی است؟

اسناد لورفته از برنامه عرضه عمومی آنتروپیک نشان می‌دهد این غول هوش مصنوعی با وجود زیان‌های میلیاردی و هزینه‌های نجومی پردازش ابری، بخش بزرگی از پرونده خود را به هشدارهای آخرالزمانی اختصاص داده است. کارشناسان معتقدند بزرگ‌نمایی خطر نابودی جهان ترفندی زیرکانه از سوی مدیران این شرکت برای فرار از پاسخگویی و جلب ارزش‌گذاری‌های حبابی در بازار بورس است.

۲۴ دقیقه مطالعه
۰
۱۳ مهر
تب داغ مدل Jev؛ بازگشت شکوهمند هوش مصنوعی پیش‌بین به میدان رقابت!
آخرین اخبار

تب داغ مدل Jev؛ بازگشت شکوهمند هوش مصنوعی پیش‌بین به میدان رقابت!

موج تازه‌ای از مدل‌های تصمیم‌گیری نظیر Jev، هوش مصنوعی پیش‌بین را پس از سال‌ها حاشیه‌نشینی دوباره به کانون توجه کشانده‌اند. با این حال، کارشناسان هشدار می‌دهند که بدون پیوند دادن اهداف کسب‌وکار با سنجه‌های فنی، این فناوری نوپا نیز در فاز عملیاتی به سرنوشت پروژه‌های ناموفق گذشته دچار خواهد شد.

۵ دقیقه مطالعه
۰
۱۳ مهر
چرا ریلزهایتان نگرفت؟ دستیار هوش مصنوعی جدید اینستاگرام دلیل شکست ویدیوها را فاش می‌کند!
آخرین اخبار

چرا ریلزهایتان نگرفت؟ دستیار هوش مصنوعی جدید اینستاگرام دلیل شکست ویدیوها را فاش می‌کند!

متا از دستیار هوش مصنوعی جدیدی با نام Edits Assistant در اپلیکیشن ویرایش اینستاگرام رونمایی کرد که دقیقاً به تولیدکنندگان محتوا توضیح می‌دهد چرا یک ریلز وایرال شده و دیگری با شکست مواجه شده است. این ابزار با تحلیل داده‌های تعاملی، ایده‌هایی کاربردی از قلاب‌های جذاب گرفته تا موزیک‌های ترند را برای بهبود عملکرد پیج پیشنهاد می‌کند.

۲ دقیقه مطالعه
۰
۱۳ مهر