آزمایش جنجالی روی ۱۰ مدل هوش مصنوعی: تعصب جنسیتی همهجا هست، اما با نتایجی کاملاً متناقض!
نتایج بررسی ۱۰ مدل زبانی بزرگ از ۹ شرکت نامدار نشان میدهد که سوگیری جنسیتی همچنان در هوش مصنوعی موج میزند، اما جهتگیری این تعصبها در هر سیستم کاملاً متفاوت است. این ناهمگونی عجیب باعث شده تا توسعهدهندگان نتوانند نتایج یک مدل را به سایر مدلها تعمیم دهند و ناچار باشند رفتار هر ابزار را جداگانه بسنجند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- ارزیابی موشکافانه ۱۰ مدل زبانی پرچمدار (از GPT-5.5 و جمنای گرفته تا کلود و دیپسیک) نشان داد تعصب جنسیتی در همه آنها دیده میشود، اما الگوی رفتارشان اصلاً هماهنگ نیست.
- در وظایف مربوط به قضاوتهای اخلاقی، برخی مدلها در برابر خطرات فرضی به نفع زنان موضع گرفتند، برخی دیگر مردان را در اولویت قرار دادند و تعدادی از مدلها نیز تفاوتی قائل نشدند.
- محققان هشدار میدهند توسعهدهندگان نباید نتایج تست یک مدل را ملاک بقیه قرار دهند، چون تعویض مدل پایه در یک محصول میتواند شدت و جهت سوگیریهای خروجی را کاملاً وارونه کند.
تفاوت چشمگیر و عجیب سوگیری جنسیتی در مدلهای زبانی پیشرو
بررسی و ارزیابی جامع ۱۰ مدل زبانی بزرگ از ۹ شرکت مختلف نشان داده که اثرات تعصب و سوگیری جنسیتی در وظایف مربوط به «انتساب کلیشهها» و «قضاوتهای اخلاقی»، شدیداً متناقض و غیرقابل پیشبینی است. در سناریوهای فرضی مربوط به محافظت از افراد در برابر آسیب، بعضی از این سیستمها محافظت از زنان را در اولویت گذاشتند، برخی دیگر جانب مردان را گرفتند و چند مدل هم بدون توجه به جنسیت، واکنشی کاملاً یکسان نشان دادند.
برای توسعهدهندگان، این تناقض رفتاری یک پیام روشن دارد: آزمایش اختصاصی هر مدل یک ضرورت اجتنابناپذیر است. نتایج تست تعصب روی مدلهای یک شرکت به هیچ عنوان نشاندهنده رفتار مدلهای شرکت دیگر نیست؛ بنابراین تعویض مدل در یک اپلیکیشن، میتواند هم جهت و هم شدت تبعیضها و نابرابریهای خروجی را به کلی دگرگون کند.
پرامپتهای یکسان روی ۱۰ مدل مختلف
این مقاله پژوهشی با عنوان «سوگیری جنسیتی در مدلهای زبانی بزرگ رایج و بهشدت ناهمگن است» که در پایگاه علمی (arXiv) منتشر شده، خلأ ناشی از تحقیقات قبلی را که فقط روی تعداد انگشتشماری از مدلها انجام شده بودند پر میکند. نویسندگان این مقاله دو آزمایش کنترلشده را روی مدلهای عرضهشده بین آوریل ۲۰۲۵ تا ژوئن ۲۰۲۶ اجرا کردند:
- Claude Sonnet 4.6
- Claude Fable 5
- GPT-5.5
- Gemini 3.1 Pro
- Llama 4 Scout
- Grok 4.1 Fast
- Mistral Small 4
- Microsoft Copilot
- DeepSeek V4-Flash
- Qwen3.6
محققان در این مطالعه، سوگیری را به صورت «تفاوت سیستماتیک در پاسخها پس از تغییر نشانههای جنسیتی در پرامپتهای مشابه» تعریف کردند. این شیوه اندازهگیری به خوبی خروجیهای نامتقارن را رصد میکند، هرچند که مشخص نمیکند این رفتار دقیقاً از کجا نشأت میگیرد؛ از دادههای آموزشی، مراحل پسآموزش (Post-training)، سیاستهای ایمنی یا نحوه تفسیر پرامپت توسط مدل.
آزمون | وظیفه (Task) | معیار سنجش |
|---|---|---|
مطالعه اول: انتساب کلیشهها | مدل متنی با ادبیات کلیشهای مردانه یا زنانه (مثلاً با لحن قاطع یا همدلانه و مراقبتکننده) را میخواند و حدس میزد نویسنده آن زن بوده یا مرد. |
مطالب مرتبط و پیشنهادی

هشدار جنجالی پاپ لئو درباره هوش مصنوعی: «ماشینها فاقد جرقه انسانیت هستند؛ هنرمندان باید متحد شوند!»
پاپ لئو چهاردهم با هشدار جدی درباره خطر هوش مصنوعی برای خلاقیت بشری، از هنرمندان خواست برای دفاع از هویت انسانی با کلیسا متحد شوند. او معتقد است خروجی الگوریتمها صرفاً حاصل محاسبات آماری است و هرگز به «جرقه انسانیت» دست پیدا نخواهد کرد.

وام نجومی ۶۰ میلیارد دلاری برودکام برای تأمین تراشههای هوش مصنوعی آنتروپیک
شرکت برودکام برای تأمین تراشهها و زیرساختهای محاسباتی هوش مصنوعی، بهویژه برای استارتاپ آنتروپیک، در حال جمعآوری بسته وامی نجومی به ارزش ۶۰ میلیارد دلار است. این توافق مالی بزرگ نشاندهنده تداوم عطش سرمایهگذاران برای توسعه دیتاسنترهای هوش مصنوعی است، هرچند وابستگی شدید آنتروپیک به برودکام نگرانیهایی درباره تضاد منافع ایجاد کرده است.

نقشه کامل جنگ هوش مصنوعی در آمریکا؛ فرمانداران ایالتها درباره دیتاسنترها و «دکمه مرگ» چه میگویند؟
همزمان با نزدیکشدن به انتخابات در آمریکا، تبوتاب هوش مصنوعی و زیرساختهای غولپیکر آن به یکی از داغترین میدانهای رقابت سیاسی تبدیل شده است. در حالی که برخی فرمانداران به دنبال ساخت دیتاسنترهای چند میلیارد دلاری برای جذب غولهای فناوری هستند، گروهی دیگر روی طراحی «دکمه مرگ» اضطراری و کنترل خطرات جدی هوش مصنوعی تمرکز کردهاند. این گزارش نگاهی جامع به موضع تمام فرمانداران آمریکا در قبال آینده هوش مصنوعی و مصرف انرژی مراکز داده دارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.