پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

پایان خطای فاحش هوش مصنوعی در فیلترینگ خودکار؛ مدل محبوب unbiased-toxic-roberta به مرز یک میلیون دانلود رسید

انتشار:۹ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

سیستم‌های هوش مصنوعی تعدیل محتوا سال‌هاست با یک باگ کلافه‌کننده دست‌وپنجه نرم می‌کنند: شناسایی اشتباه کلمات خنثی هویتی به‌عنوان فحاشی و محتوای نامناسب! حالا مدل متن‌باز unbiased-toxic-roberta با عبور از مرز یک میلیون دانلود، نشان داده چطور می‌توان با مهار این سوگیری‌های ناخواسته، ابزاری سبک، دقیق و کارآمد را مستقیماً روی سیستم‌های محلی پیاده‌سازی کرد.

پایان خطای فاحش هوش مصنوعی در فیلترینگ خودکار؛ مدل محبوب unbiased-toxic-roberta به مرز یک میلیون دانلود رسید

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل ۱۲۵ میلیون پارامتری unbiased-toxic-roberta از شرکت Unitary با رد کردن مرز یک میلیون دانلود در هاگینگ‌فیس حسابی ترند شده؛ این مدل مشکل قدیمی فیلترینگ خودکار یعنی برچسب زدن اشتباه روی کلمات خنثی هویتی رو حل کرده است.
  • این پروژه بر پایه کتابخانه متن‌باز Detoxify و با مجوز آپاچی ۲ عرضه شده، کاملاً رایگانه و توسعه‌دهنده‌ها می‌تونن بدون نیاز به ابزار‌های ابری و به‌شکل محلی روی سیستم خودشون اجراش کنن.
  • این مدل تو یه پردازش سریع، متون رو برای ۷ نوع رفتار نامناسب (از کلمات رکیک و تهدید گرفته تا حملات هویتی) بررسی می‌کنه و به هر بخش نمره‌ای مستقل بین صفر تا یک می‌ده تا بشه فیلترهای دقیق‌تری تنظیم کرد.

بر اساس تازه‌ترین اطلاعات صفحه این مدل در هاگینگ‌فیس، طبقه‌بندی‌کننده unbiased-toxic-roberta متعلق به شرکت یونیتاری (Unitary) با ثبت نزدیک به یک میلیون بار دانلود و بیش از ۳,۵۰۰ لایک، به یکی از ابزار‌های بسیار محبوب توسعه‌دهندگان تبدیل شده است. این مدل انگلیسی با ۱۲۵ میلیون پارامتر، دست روی یکی از کلافه‌کننده‌ترین خطاهای رایج در سیستم‌های تعدیل محتوا گذاشته است: جایی که اصطلاحات خنثی هویتی، صرفاً به این دلیل که در داده‌های آموزشی معمولاً در کنار متن‌های توهین‌آمیز تکرار شده‌اند، نمره سمیت بالا دریافت می‌کنند و به اشتباه مسدود می‌شوند! حالا توسعه‌دهندگان به یک ابزار پایه، متن‌باز و قابل اجرا روی سیستم محلی دسترسی دارند که خروجی‌های تفکیک‌شده ارائه می‌دهد و هدف اصلی‌اش رفع همین سوگیری‌های ناخواسته است.

این مدل در واقع چک‌پوینت unbiased از مخزن کد Detoxify است؛ پروژه‌ای که مدل‌های مختلفی را برای چالش‌های کامنت‌های سمی پلتفرم جیگساو (Jigsaw)، از جمله مسابقات سوگیری ناخواسته و داده‌های چندزبانه ارائه داده است. لورا هانو (Laura Hanu) این پروژه را در شرکت Unitary با کمک فریم‌ورک‌های PyTorch Lightning و Transformers هاگینگ‌فیس توسعه داده و این مخزن و مدل تحت مجوز آپاچی ۲ (Apache-2.0) به‌صورت کاملاً رایگان در دسترس است.

ارزیابی هفت فاکتور سمیت کلامی تنها با یک‌بار پردازش

این چک‌پوینت با یک‌بار بررسی متن، برای هفت دسته از رفتارهای مخرب و نامناسب نمراتی مستقل و مشابه احتمال بین ۰ تا ۱ محاسبه می‌کند. نرم‌افزارها و ابزار‌های نظارتی می‌توانند هر نمره را جداگانه بررسی کنند، آستانه مجاز (Threshold) اختصاصی برای هر دسته در نظر بگیرند یا این نتایج را با سایر سیگنال‌های فیلترینگ ترکیب نمایند.

گروه
برچسب‌ها
شامل چه مواردی می‌شود؟
سمیت کلی
toxicity, severe_toxicity
سیگنال‌های کلی ادبیات مخرب تا موارد شدیدتر و افراطی
ادبیات توهین‌آمیز
obscene, threat, insult
کلمات رکیک، تهدید به آسیب و خشونت، و توهین مستقیم
محتوای هدفمند یا صریح
identity_attack, sexual_explicit
حملات کلامی بر پایه هویت افراد و الفاظ صریح جنسی

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

هشدار جدی شرکت مایکرون: ربات‌ها تمام رم‌های بازار را می‌بلعند؛ نیاز به بیش از ۲۰۰ گیگابایت حافظه برای هر ربات انسان‌نما!
آخرین اخبار

هشدار جدی شرکت مایکرون: ربات‌ها تمام رم‌های بازار را می‌بلعند؛ نیاز به بیش از ۲۰۰ گیگابایت حافظه برای هر ربات انسان‌نما!

شرکت مایکرون در جدید‌ترین پیش‌بینی خود هشدار داده که بحران کمبود حافظه رم در سال‌های ۲۰۲۷ و ۲۰۲۸ به اوج خود می‌رسد و به این زودی‌ها رفع نخواهد شد. به گفته این غول دنیای تراشه، ورود ربات‌های انسان‌نما و «هوش مصنوعی فیزیکی» که در هر دستگاه به بیش از ۲۰۰ گیگابایت رم نیاز دارند، کمبود و گرانی حافظه را تا سال ۲۰۳۰ تمدید خواهد کرد.

۳ دقیقه مطالعه
۰
۹ مهر
قمار بزرگ هالیوود روی فیلم‌های هوش مصنوعی همزمان با دل‌زدگی تماشاگران: «قرار نیست جای انسان را بگیریم!»
آخرین اخبار

قمار بزرگ هالیوود روی فیلم‌های هوش مصنوعی همزمان با دل‌زدگی تماشاگران: «قرار نیست جای انسان را بگیریم!»

در حالی که استودیوهای بزرگ هالیوود و مدیران کهنه‌کار سینما سرمایه‌گذاری سنگینی را روی تولید فیلم با هوش مصنوعی آغاز کرده‌اند، آمار‌ها از دل‌زدگی و بی‌میلی روزافزون تماشاگران حکایت دارد. از سوی دیگر، چهره‌های سرشناسی چون تام کروز بر اهمیت بی‌بدیل تجربه و احساس واقعی انسانی در پرده نقره‌ای تأکید می‌کنند.

۶ دقیقه مطالعه
۰
۹ مهر
جنگ تمام‌عیار هوش مصنوعی در فاکتورهای درمانی؛ هزینه‌های میلیاردی که از جیب بیماران می‌رود!
آخرین اخبار

جنگ تمام‌عیار هوش مصنوعی در فاکتورهای درمانی؛ هزینه‌های میلیاردی که از جیب بیماران می‌رود!

در حالی که انتظار می‌رفت هوش مصنوعی هزینه‌های سرسام‌آور درمان را مهار کند، گزارش‌های جدید نشان می‌دهند الگوریتم‌های صورت‌حساب بیمارستان‌ها نزدیک به یک میلیارد دلار هزینه اضافی روی دست بیمه‌ها گذاشته‌اند. شکل‌گیری یک مسابقه تسلیحاتی تمام‌عیار میان هوش مصنوعی بیمارستان‌ها برای صدور فاکتورهای سنگین‌تر و ربات‌های بیمه برای رد درخواست‌ها، در نهایت بیماران را مجبور می‌کند تاوان این جنگ نرم‌افزاری را با پرداخت حق بیمه‌های بالا‌تر بپردازند.

۷ دقیقه مطالعه
۰
۹ مهر