پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

محققان Stanford با روش MAttr رکورد بنچمارک تفسیرپذیری هوش مصنوعی را شکستند

انتشار:۲ مهر ۱۴۰۵(۴ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

تیمی از پژوهشگران دانشگاه Stanford روش نوآورانه‌ای به نام Matryoshka Attribution یا MAttr معرفی کرده‌اند که با چارچوب‌بندی مسئله تفسیرپذیری مدل‌ها به‌صورت یادگیری رتبه‌بندی از طریق گرادیان نزولی، گامی بزرگ در درک ساختار درونی هوش مصنوعی برداشته است. این روش موفق شد با عملکردی تا ۳ برابر بهتر از راهکارهای پیشین، در صدر بنچمارک تفسیرپذیری مکانیکی قرار گیرد.

محققان Stanford با روش MAttr رکورد بنچمارک تفسیرپذیری هوش مصنوعی را شکستند

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • معرفی روش نوین Matryoshka Attribution (به‌اختصار MAttr) توسط محققان دانشگاه Stanford برای رتبه‌بندی مؤلفه‌های داخلی مدل‌های هوش مصنوعی.
  • دستیابی به بالاترین امتیاز در بخش گره‌های بنچمارک تفسیرپذیری مکانیکی با عملکردی تا ۳ برابر بهتر از روش‌های پیشین.
  • امکان استخراج مدارهای عصبی در سطوح متنوع تنک‌سازی تنها با یک بار اجرای آموزش و بدون نیاز به بهینه‌سازی‌های مکرر.
  • قابلیت اعمال مستقیم بر هدهای توجه، بلوک‌های MLP، نورون‌ها و ویژگی‌های اتوانکودرهای تنک در مدلهای زبانی.

یادگیری یک رتبه‌بندی واحد برای اندازه‌های مختلف مدارهای عصبی با Matryoshka Attribution

گروهی از پژوهشگران به رهبری دانشگاه Stanford روش جدیدی به نام Matryoshka Attribution یا MAttr معرفی کرده‌اند که هدف آن رتبه‌بندی مؤلفه‌های داخلی مدل است که رفتارهای مشخص هوش مصنوعی را شکل می‌دهند. این رویکرد موفق شد بالاترین امتیاز را در بخش گره‌های بنچمارک تفسیرپذیری مکانیکی (Mechanistic Interpretability Benchmark) کسب کند. در این روش، تنها یک بار اجرای فرایند آموزش، رتبه‌بندی جامعی ایجاد می‌کند که می‌توان آن را در سطوح مختلف تنک‌سازی (Sparsity) برش زد؛ این ویژگی نیاز به اجرای مکرر فرایندهای بهینه‌سازی را برطرف کرده و مقایسه مدارهای عصبی در ابعاد گوناگون را بسیار آسان‌تر می‌سازد.

این مقاله پژوهشی که توسط آریامان آرورا (Aryaman Arora) و همکارانش از جمله نوآ گودمن (Noah Goodman)، دن ژورافسکی (Dan Jurafsky) و کریستوفر پاتس (Christopher Potts) تدوین شده است، مسئله انتساب یا نسبت‌دهی (Attribution) را به‌صورت یک مسئله بهینه‌سازی روی مجموعه‌های تودرتو از مؤلفه‌ها بازتعریف می‌کند. این متدولوژی روی هدهای توجه (Attention Heads)، بلوک‌های MLP، نورون‌ها، ویژگی‌های اتوانکودرهای تنک (Sparse Autoencoders) و همچنین به‌روزرسانی پارامترها میان چک‌پوینت‌های مختلف قابل اجرا است.

چرا محلی‌سازی رفتارها در مدلهای زبانی پرهزینه است؟

یک مدل زبانی فرایند محاسبات را میان مؤلفه‌های تعاملی پرشماری توزیع می‌کند؛ هدهای توجه داده‌ها را بین موقعیت توکن‌ها جابه‌جا می‌کنند، در حالی که بلوک‌های MLP بازنمایی هر موقعیت را دگرگون می‌سازند. پژوهشگران برای محلی‌سازی و ردیابی دقیق یک رفتار، بررسی می‌کنند که کدام مؤلفه‌ها در صورت مداخله، آن رفتار را حفظ کرده، تضعیف می‌کنند یا کاملاً از بین می‌برند.

رویکرد
سازوکار
مهم‌ترین سبک‌سنگینی (Trade-off)
حذف علی (Causal ablation)
غیرفعال‌سازی مؤلفه‌ها و اندازه‌گیری تغییر رفتار مدل
شواهد مداخله‌ای مستقیمی ارائه می‌دهد، اما بررسی تمام ترکیب‌ها محاسبات بسیار سنگینی دارد
انتساب گرادیانی (Gradient attribution)
مشتق‌گیری از امتیاز رفتار نسبت به مؤلفه‌ها
سرعت اجرای بالایی دارد، اما حساسیت محلی را می‌سنجد نه اثرگذاری جامع ناشی از حذف کامل مؤلفه
یادگیری ماسک با بودجه ثابت (Fixed-budget mask learning)
بهینه‌سازی یک انتخاب‌گر برای اندازه مشخصی از مدار عصبی
امکان دستیابی به مدارهای فشرده را دارد، اما برای ابعاد مختلف نیازمند اجرای مکرر و مستقل است
روش MAttr
بهینه‌سازی یک رتبه‌بندی مشترک هم‌زمان با نمونه‌برداری از ابعاد مدار
پوشش سطوح مختلف تنک‌سازی تنها در یک بار اجرا، هرچند همچنان نیازمند آموزش اختصاصی برای هر تسک است

یک رتبه‌بندی، ابعاد متنوعی از مدارهای عصبی

روش MAttr یک امتیاز قابل یادگیری به هر مؤلفه کاندید اختصاص می‌دهد. در این ساختار، یک عملگر دیفرانسیل‌پذیر سیگموئید top-k این امتیازها را برای بودجه انتخابی به یک ماسک تبدیل می‌کند و به گرادیان‌ها اجازه می‌دهد رتبه‌بندی را در حین آموزش به‌روزرسانی کنند. در مرحله ارزیابی نیز امتیازها مرتب شده و برترین مؤلفه‌ها متناسب با اندازه مورد نظر انتخاب می‌شوند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر
محققان Stanford با روش MAttr رکورد بنچمارک تفسیرپذیری هوش مصنوعی را شک | WireAI