غول کوچک مایکروسافت؛ چرا مدل DeBERTa-v3-small با نصف پارامترها روبرتا را شکست میدهد؟
مدل DeBERTa-v3-small مایکروسافت با وجود اینکه مدتها پیش از تبوتاب فعلی مدلهای زبانی عرضه شده، هنوز هم با صدها هزار دانلود ماهانه در هاگینگ فیس یکی از محبوبترین ابزارهای توسعهدهندگان است. این انکودر کمحجم با معماری ۶ لایهای خود عملکرد فوقالعادهای در پردازش زبان طبیعی به نمایش میگذارد و با نصف پارامترها رقبایی مثل RoBERTa را به چالش میکشد. اما جالب است بدانید که پشت برچسب ۴۴ میلیون پارامتری آن، یک راز فنی جالب و وزنهای پنهانی دیگری قرار دارد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل پرطرفدار DeBERTa-v3-small از تیم تحقیقات مایکروسافت تنها در یک ماه اخیر حدود ۷۷۷ هزار بار در هاگینگ فیس دانلود شده و بیش از ۲۳۰ مشتق فاینتیون و کوانتایز دارد.
- برچسب ۴۴ میلیون پارامتری فقط بدنه ترنسفورمر را نشان میدهد؛ در حالی که جدول واژگان ۱۲۸ هزار توکنی، حدود ۹۸ میلیون پارامتر دیگر (نزدیک به ۶۹ درصد کل مدل) به آن اضافه میکند.
- این انکودر با وجود جثه جمعوجور و تنها ۶ لایه ترنسفورمر، در بنچمارکهای درک زبان طبیعی (مانند SQuAD 2.0) پابهپای مدلهای بزرگتر رقابت میکند و با مجوز آزاد MIT عرضه شده است.
چرا توسعهدهندگان همچنان دست از دانلود DeBERTa-v3-small برنمیدارند؟
مدل DeBERTa-v3-small از بخش تحقیقات مایکروسافت، در ماه اخیر آمار خیرهکننده حدود ۷۷۷ هزار دانلود را در پلتفرم هاگینگ فیس ثبت کرده است. در حال حاضر، بیش از ۲۱۳ نسخه فاینتیون شده و ۲۰ مشتق کوانتایز از این مدل در هاب هاگینگ فیس در دسترس قرار دارد. هرچند این ارقام شامل دانلودهای خودکار و پایپلاینها هم میشود، اما به خوبی نشاندهنده علاقه و فعالیت مستمر پیرامون مدلی است که مدتها قبل از موج کنونی مدلهای زبانی صرفاً دیکودر عرضه شده بود.
راز این محبوبیت در یک ترکیب بسیار کاربردی نهفته است: امتیازهای رقابتی چشمگیر در بنچمارکهای درک زبان طبیعی، تنها ۶ لایه ترنسفورمر، پشتیبانی گسترده در فریمورکهای گوناگون و البته مجوز کاملاً آزاد MIT. با این حال، دایره واژگان فوقالعاده بزرگ این مدل، داستان ابعاد و حجم واقعی آن را کمی پیچیده میکند؛ چرا که بدنه اصلی ترنسفورمر ۴۴ میلیون پارامتر دارد، در حالی که چکپوینت کامل پایه شامل حدود ۱۴۲ میلیون پارامتر است.
پشت برچسب ۴۴ میلیونی، ۱۴۲ میلیون وزن نهفته است!
عددی که در شناسنامه مدل به عنوان ۴۴ میلیون پارامتر ذکر شده، صرفاً مربوط به ستون فقرات یا همان بدنه اصلی ترنسفورمر است و جدول امبدینگ توکنها را در بر نمیگیرد. در واقع، دایره واژگان ۱۲۸ هزار توکنی همراه با امبدینگهای ۷۶۸ بُعدی، حدود ۹۸ میلیون پارامتر دیگر به مدل اضافه میکند که به تنهایی نزدیک به ۶۹ درصد از کل وزنهای چکپوینت را تشکیل میدهد.
مشخصه | مقدار |
|---|---|
لایههای ترنسفورمر | ۶ |
اندازه مخفی (Hidden size) | ۷۶۸ |
هدهای توجه (Attention heads) | ۱۲ |
پارامترهای بدنه اصلی (Backbone) | ۴۴ میلیون |
پارامترهای امبدینگ توکن | حدود ۹۸ میلیون |
کل پارامترهای پایه | حدود ۱۴۲ میلیون |
دایره واژگان (Vocabulary) | ۱۲۸٬۰۰۰ توکن |
حداکثر طول ورودی | ۵۱۲ توکن |
دادههای پیشآموزش | ۱۶۰ گیگابایت، مطابق با DeBERTa V2 |
مجوز | MIT |
نصف بدنه، اما نتایجی کاملاً رقابتی
بر اساس گزارش شناسنامه مدل مایکروسافت، نتایج بهدستآمده بسیار جالبتوجه است. ستون پارامترها در جدول زیر، تنها شامل بدنه اصلی ترنسفورمر هر مدل میشود تا مقایسه فارغ از ابعاد متغیر جدولهای امبدینگ و دایره واژگان انجام پذیرد:
مدل | پارامترهای بدنه اصلی | امتیاز SQuAD 2.0 (F1 / EM) |
|---|
مطالب مرتبط و پیشنهادی

شتاب خیرهکننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکنها
تیم OpenBMB با انتشار مدل کمحجم ۳۲۴ میلیون پارامتری DSpark، جهش بزرگی در سرعت استنتاج مدل زبانی MiniCPM5-2B ایجاد کرده است. این مدل با تکیه بر تکنیک هوشمندانه رمزگشایی گمانهزنانه، توکنها را به صورت دستهای حدس میزند تا فرایند پردازش با کمترین مصرف محاسباتی و بیشترین سرعت ممکن اجرا شود.

پیودیپای: موقع ساخت هوش مصنوعی اختصاصیام، OpenAI دو بار اکانتم را بست!
فلیکس شلبرگ یا همان پیودیپای معروف، بهتازگی مدل هوش مصنوعی محلی خود به نام Ajax را معرفی کرده، اما فاش ساخته که در مسیر توسعه آن، شرکت OpenAI دو بار حسابش را مسدود کرده است. او برای ساخت این مدل ۹ میلیارد پارامتری از تکنیک تقطیر استفاده کرده؛ موضوعی که زنگ خطر نقض قوانین سازنده ChatGPT را به صدا درآورده است.

طعنه سنگین سم آلتمن به آنتروپیک: نسبت دادن روح و دین به هوش مصنوعی خطرناکه!
سم آلتمن، مدیرعامل اوپنایآی، در اظهارنظری جنجالی به رویکرد شرکت رقیب یعنی آنتروپیک تاخت و نسبت دادن مفاهیم مذهبی و خودآگاهی به مدلهای هوش مصنوعی را یک تهدید امنیتی واقعی دانست. این اختلافنظر تازه پس از آن بالا گرفت که گزارشهایی از گفتوگوهای آنتروپیک با رهبران دینی برای تزریق اخلاق به مدلها منتشر شد. حالا دانشمندان ارشد هوش مصنوعی و حتی واتیکان هم به این مناقشه فلسفی کشیده شدهاند و درباره خطرات چنین رویکردی هشدار میدهند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.