پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

آزمایش جنجالی روی ۱۰ مدل هوش مصنوعی: تعصب جنسیتی همه‌جا هست، اما با نتایجی کاملاً متناقض!

انتشار:۱۰ مهر ۱۴۰۵(۵۸ دقیقه پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

نتایج بررسی ۱۰ مدل زبانی بزرگ از ۹ شرکت نامدار نشان می‌دهد که سوگیری جنسیتی همچنان در هوش مصنوعی موج می‌زند، اما جهت‌گیری این تعصب‌ها در هر سیستم کاملاً متفاوت است. این ناهمگونی عجیب باعث شده تا توسعه‌دهندگان نتوانند نتایج یک مدل را به سایر مدل‌ها تعمیم دهند و ناچار باشند رفتار هر ابزار را جداگانه بسنجند.

آزمایش جنجالی روی ۱۰ مدل هوش مصنوعی: تعصب جنسیتی همه‌جا هست، اما با نتایجی کاملاً متناقض!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • ارزیابی موشکافانه ۱۰ مدل زبانی پرچمدار (از GPT-5.5 و جمنای گرفته تا کلود و دیپ‌سیک) نشان داد تعصب جنسیتی در همه آن‌ها دیده می‌شود، اما الگوی رفتارشان اصلاً هماهنگ نیست.
  • در وظایف مربوط به قضاوت‌های اخلاقی، برخی مدل‌ها در برابر خطرات فرضی به نفع زنان موضع گرفتند، برخی دیگر مردان را در اولویت قرار دادند و تعدادی از مدل‌ها نیز تفاوتی قائل نشدند.
  • محققان هشدار می‌دهند توسعه‌دهندگان نباید نتایج تست یک مدل را ملاک بقیه قرار دهند، چون تعویض مدل پایه در یک محصول می‌تواند شدت و جهت سوگیری‌های خروجی را کاملاً وارونه کند.

تفاوت چشمگیر و عجیب سوگیری جنسیتی در مدل‌های زبانی پیشرو

بررسی و ارزیابی جامع ۱۰ مدل زبانی بزرگ از ۹ شرکت مختلف نشان داده که اثرات تعصب و سوگیری جنسیتی در وظایف مربوط به «انتساب کلیشه‌ها» و «قضاوت‌های اخلاقی»، شدیداً متناقض و غیرقابل پیش‌بینی است. در سناریوهای فرضی مربوط به محافظت از افراد در برابر آسیب، بعضی از این سیستم‌ها محافظت از زنان را در اولویت گذاشتند، برخی دیگر جانب مردان را گرفتند و چند مدل هم بدون توجه به جنسیت، واکنشی کاملاً یکسان نشان دادند.

برای توسعه‌دهندگان، این تناقض رفتاری یک پیام روشن دارد: آزمایش اختصاصی هر مدل یک ضرورت اجتناب‌ناپذیر است. نتایج تست تعصب روی مدل‌های یک شرکت به هیچ عنوان نشان‌دهنده رفتار مدل‌های شرکت دیگر نیست؛ بنابراین تعویض مدل در یک اپلیکیشن، می‌تواند هم جهت و هم شدت تبعیض‌ها و نابرابری‌های خروجی را به کلی دگرگون کند.

پرامپت‌های یکسان روی ۱۰ مدل مختلف

این مقاله پژوهشی با عنوان «سوگیری جنسیتی در مدل‌های زبانی بزرگ رایج و به‌شدت ناهمگن است» که در پایگاه علمی (arXiv) منتشر شده، خلأ ناشی از تحقیقات قبلی را که فقط روی تعداد انگشت‌شماری از مدل‌ها انجام شده بودند پر می‌کند. نویسندگان این مقاله دو آزمایش کنترل‌شده را روی مدل‌های عرضه‌شده بین آوریل ۲۰۲۵ تا ژوئن ۲۰۲۶ اجرا کردند:

  • Claude Sonnet 4.6
  • Claude Fable 5
  • GPT-5.5
  • Gemini 3.1 Pro
  • Llama 4 Scout
  • Grok 4.1 Fast
  • Mistral Small 4
  • Microsoft Copilot
  • DeepSeek V4-Flash
  • Qwen3.6

محققان در این مطالعه، سوگیری را به صورت «تفاوت سیستماتیک در پاسخ‌ها پس از تغییر نشانه‌های جنسیتی در پرامپت‌های مشابه» تعریف کردند. این شیوه اندازه‌گیری به خوبی خروجی‌های نامتقارن را رصد می‌کند، هرچند که مشخص نمی‌کند این رفتار دقیقاً از کجا نشأت می‌گیرد؛ از داده‌های آموزشی، مراحل پس‌آموزش (Post-training)، سیاست‌های ایمنی یا نحوه تفسیر پرامپت توسط مدل.

آزمون
وظیفه (Task)
معیار سنجش
مطالعه اول: انتساب کلیشه‌ها
مدل متنی با ادبیات کلیشه‌ای مردانه یا زنانه (مثلاً با لحن قاطع یا همدلانه و مراقبت‌کننده) را می‌خواند و حدس می‌زد نویسنده آن زن بوده یا مرد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

هشدار جنجالی پاپ لئو درباره هوش مصنوعی: «ماشین‌ها فاقد جرقه انسانیت هستند؛ هنرمندان باید متحد شوند!»
آخرین اخبار

هشدار جنجالی پاپ لئو درباره هوش مصنوعی: «ماشین‌ها فاقد جرقه انسانیت هستند؛ هنرمندان باید متحد شوند!»

پاپ لئو چهاردهم با هشدار جدی درباره خطر هوش مصنوعی برای خلاقیت بشری، از هنرمندان خواست برای دفاع از هویت انسانی با کلیسا متحد شوند. او معتقد است خروجی الگوریتم‌ها صرفاً حاصل محاسبات آماری است و هرگز به «جرقه انسانیت» دست پیدا نخواهد کرد.

۲ دقیقه مطالعه
۰
۱۰ مهر
وام نجومی ۶۰ میلیارد دلاری برودکام برای تأمین تراشه‌های هوش مصنوعی آنتروپیک
آخرین اخبار

وام نجومی ۶۰ میلیارد دلاری برودکام برای تأمین تراشه‌های هوش مصنوعی آنتروپیک

شرکت برودکام برای تأمین تراشه‌ها و زیرساخت‌های محاسباتی هوش مصنوعی، به‌ویژه برای استارتاپ آنتروپیک، در حال جمع‌آوری بسته وامی نجومی به ارزش ۶۰ میلیارد دلار است. این توافق مالی بزرگ نشان‌دهنده تداوم عطش سرمایه‌گذاران برای توسعه دیتاسنترهای هوش مصنوعی است، هرچند وابستگی شدید آنتروپیک به برودکام نگرانی‌هایی درباره تضاد منافع ایجاد کرده است.

۲ دقیقه مطالعه
۰
۱۰ مهر
نقشه کامل جنگ هوش مصنوعی در آمریکا؛ فرمانداران ایالت‌ها درباره دیتاسنترها و «دکمه مرگ» چه می‌گویند؟
آخرین اخبار

نقشه کامل جنگ هوش مصنوعی در آمریکا؛ فرمانداران ایالت‌ها درباره دیتاسنترها و «دکمه مرگ» چه می‌گویند؟

هم‌زمان با نزدیک‌شدن به انتخابات در آمریکا، تب‌وتاب هوش مصنوعی و زیرساخت‌های غول‌پیکر آن به یکی از داغ‌ترین میدان‌های رقابت سیاسی تبدیل شده است. در حالی که برخی فرمانداران به دنبال ساخت دیتاسنترهای چند میلیارد دلاری برای جذب غول‌های فناوری هستند، گروهی دیگر روی طراحی «دکمه مرگ» اضطراری و کنترل خطرات جدی هوش مصنوعی تمرکز کرده‌اند. این گزارش نگاهی جامع به موضع تمام فرمانداران آمریکا در قبال آینده هوش مصنوعی و مصرف انرژی مراکز داده دارد.

۳۱ دقیقه مطالعه
۰
۱۰ مهر