پایان خطای فاحش هوش مصنوعی در فیلترینگ خودکار؛ مدل محبوب unbiased-toxic-roberta به مرز یک میلیون دانلود رسید
سیستمهای هوش مصنوعی تعدیل محتوا سالهاست با یک باگ کلافهکننده دستوپنجه نرم میکنند: شناسایی اشتباه کلمات خنثی هویتی بهعنوان فحاشی و محتوای نامناسب! حالا مدل متنباز unbiased-toxic-roberta با عبور از مرز یک میلیون دانلود، نشان داده چطور میتوان با مهار این سوگیریهای ناخواسته، ابزاری سبک، دقیق و کارآمد را مستقیماً روی سیستمهای محلی پیادهسازی کرد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل ۱۲۵ میلیون پارامتری unbiased-toxic-roberta از شرکت Unitary با رد کردن مرز یک میلیون دانلود در هاگینگفیس حسابی ترند شده؛ این مدل مشکل قدیمی فیلترینگ خودکار یعنی برچسب زدن اشتباه روی کلمات خنثی هویتی رو حل کرده است.
- این پروژه بر پایه کتابخانه متنباز Detoxify و با مجوز آپاچی ۲ عرضه شده، کاملاً رایگانه و توسعهدهندهها میتونن بدون نیاز به ابزارهای ابری و بهشکل محلی روی سیستم خودشون اجراش کنن.
- این مدل تو یه پردازش سریع، متون رو برای ۷ نوع رفتار نامناسب (از کلمات رکیک و تهدید گرفته تا حملات هویتی) بررسی میکنه و به هر بخش نمرهای مستقل بین صفر تا یک میده تا بشه فیلترهای دقیقتری تنظیم کرد.
بر اساس تازهترین اطلاعات صفحه این مدل در هاگینگفیس، طبقهبندیکننده unbiased-toxic-roberta متعلق به شرکت یونیتاری (Unitary) با ثبت نزدیک به یک میلیون بار دانلود و بیش از ۳,۵۰۰ لایک، به یکی از ابزارهای بسیار محبوب توسعهدهندگان تبدیل شده است. این مدل انگلیسی با ۱۲۵ میلیون پارامتر، دست روی یکی از کلافهکنندهترین خطاهای رایج در سیستمهای تعدیل محتوا گذاشته است: جایی که اصطلاحات خنثی هویتی، صرفاً به این دلیل که در دادههای آموزشی معمولاً در کنار متنهای توهینآمیز تکرار شدهاند، نمره سمیت بالا دریافت میکنند و به اشتباه مسدود میشوند! حالا توسعهدهندگان به یک ابزار پایه، متنباز و قابل اجرا روی سیستم محلی دسترسی دارند که خروجیهای تفکیکشده ارائه میدهد و هدف اصلیاش رفع همین سوگیریهای ناخواسته است.
این مدل در واقع چکپوینت unbiased از مخزن کد Detoxify است؛ پروژهای که مدلهای مختلفی را برای چالشهای کامنتهای سمی پلتفرم جیگساو (Jigsaw)، از جمله مسابقات سوگیری ناخواسته و دادههای چندزبانه ارائه داده است. لورا هانو (Laura Hanu) این پروژه را در شرکت Unitary با کمک فریمورکهای PyTorch Lightning و Transformers هاگینگفیس توسعه داده و این مخزن و مدل تحت مجوز آپاچی ۲ (Apache-2.0) بهصورت کاملاً رایگان در دسترس است.
ارزیابی هفت فاکتور سمیت کلامی تنها با یکبار پردازش
این چکپوینت با یکبار بررسی متن، برای هفت دسته از رفتارهای مخرب و نامناسب نمراتی مستقل و مشابه احتمال بین ۰ تا ۱ محاسبه میکند. نرمافزارها و ابزارهای نظارتی میتوانند هر نمره را جداگانه بررسی کنند، آستانه مجاز (Threshold) اختصاصی برای هر دسته در نظر بگیرند یا این نتایج را با سایر سیگنالهای فیلترینگ ترکیب نمایند.
گروه | برچسبها | شامل چه مواردی میشود؟ |
|---|---|---|
سمیت کلی | toxicity, severe_toxicity | سیگنالهای کلی ادبیات مخرب تا موارد شدیدتر و افراطی |
ادبیات توهینآمیز | obscene, threat, insult | کلمات رکیک، تهدید به آسیب و خشونت، و توهین مستقیم |
محتوای هدفمند یا صریح | identity_attack, sexual_explicit | حملات کلامی بر پایه هویت افراد و الفاظ صریح جنسی |
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

هشدار جدی شرکت مایکرون: رباتها تمام رمهای بازار را میبلعند؛ نیاز به بیش از ۲۰۰ گیگابایت حافظه برای هر ربات انساننما!
شرکت مایکرون در جدیدترین پیشبینی خود هشدار داده که بحران کمبود حافظه رم در سالهای ۲۰۲۷ و ۲۰۲۸ به اوج خود میرسد و به این زودیها رفع نخواهد شد. به گفته این غول دنیای تراشه، ورود رباتهای انساننما و «هوش مصنوعی فیزیکی» که در هر دستگاه به بیش از ۲۰۰ گیگابایت رم نیاز دارند، کمبود و گرانی حافظه را تا سال ۲۰۳۰ تمدید خواهد کرد.

قمار بزرگ هالیوود روی فیلمهای هوش مصنوعی همزمان با دلزدگی تماشاگران: «قرار نیست جای انسان را بگیریم!»
در حالی که استودیوهای بزرگ هالیوود و مدیران کهنهکار سینما سرمایهگذاری سنگینی را روی تولید فیلم با هوش مصنوعی آغاز کردهاند، آمارها از دلزدگی و بیمیلی روزافزون تماشاگران حکایت دارد. از سوی دیگر، چهرههای سرشناسی چون تام کروز بر اهمیت بیبدیل تجربه و احساس واقعی انسانی در پرده نقرهای تأکید میکنند.

جنگ تمامعیار هوش مصنوعی در فاکتورهای درمانی؛ هزینههای میلیاردی که از جیب بیماران میرود!
در حالی که انتظار میرفت هوش مصنوعی هزینههای سرسامآور درمان را مهار کند، گزارشهای جدید نشان میدهند الگوریتمهای صورتحساب بیمارستانها نزدیک به یک میلیارد دلار هزینه اضافی روی دست بیمهها گذاشتهاند. شکلگیری یک مسابقه تسلیحاتی تمامعیار میان هوش مصنوعی بیمارستانها برای صدور فاکتورهای سنگینتر و رباتهای بیمه برای رد درخواستها، در نهایت بیماران را مجبور میکند تاوان این جنگ نرمافزاری را با پرداخت حق بیمههای بالاتر بپردازند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.