پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل SPLADE شرکت Naver با عبور از ۸۷۸ هزار دانلود در Hugging Face خبرساز شد

انتشار:۳ مهر ۱۴۰۵(۳ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

مدل بازیابی متنی splade-cocondenser-selfdistil متعلق به آزمایشگاه Naver Labs با ثبت بیش از ۸۷۸ هزار دانلود در پلتفرم Hugging Face، بار دیگر در کانون توجه توسعه‌دهندگان سیستم‌های RAG قرار گرفت. این مدل با تلفیق گسترش معنایی یادگیری‌شده و نمایه‌سازی معکوس، گزینه‌ای قدرتمند برای ارتقای دقت جست‌وجوی متنی به شمار می‌رود.

مدل SPLADE شرکت Naver با عبور از ۸۷۸ هزار دانلود در Hugging Face خبرساز شد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل بازیابی اطلاعات splade-cocondenser-selfdistil توسعه‌یافته توسط Naver Labs با عبور از مرز ۸۷۸ هزار دانلود در Hugging Face در میان مدل‌های ترند قرار گرفت.
  • این مدل بر پایه معماری BERT با ۱۱۰ میلیون پارامتر، بردارهای اسپارس ۳۰٬۵۲۲ بعدی متناظر با واژگان WordPiece تولید می‌کند و واژگان غایب در متن را برای بهبود جست‌وجو گسترش می‌دهد.
  • امتیاز شباهت در SPLADE از طریق ضرب داخلی محاسبه شده و در بنچمارک MS MARCO به معیار MRR@10 معادل ۳۷٫۶ درصد دست یافته است.
  • اگرچه آمار دانلود در پلتفرم Hugging Face لزوماً به معنای استقرار گسترده در محیط پروداکشن نیست، اما نشان‌دهنده توجه روزافزون به بازیابی متنی اسپارس در معماری‌های RAG است.

چرا مدل بازیابی SPLADE متعلق به Naver دوباره ترند شده است؟

پلتفرم Hugging Face اخیراً چک‌پوینت splade-cocondenser-selfdistil متعلق به Naver Labs را در فهرست مدل‌های ترند خود قرار داده و شمارنده عمومی آن از مرز ۸۷۸ هزار دانلود عبور کرده است. این مدل به سیستم‌های مبتنی‌بر هوش مصنوعی مولد با قابلیت بازیابی دانش (RAG)، امکان گسترش معنایی یادگیری‌شده، وزن‌دهی شفاف و قابل‌بررسی به توکن‌ها و جست‌وجوی بهینه با فهرست معکوس (Posting List) را می‌دهد.

شمارنده‌های پلتفرم Hugging Face تعداد درخواست‌های فایل را ثبت می‌کنند که شامل دانلودهای تکراری، کش‌ها و فرایندهای خودکار نیز می‌شود؛ بنابراین این رقم نشان‌دهنده استقرار منحصربه‌فرد این مدل در محیط‌های عملیاتی نیست. با این حال، این حجم از توجه بار دیگر نگاه‌ها را به یک استاندارد شناخته‌شده در حوزه بازیابی اسپارس (Sparse Retrieval) معطوف کرده است که در پژوهش‌های سال ۲۰۲۲ با تمرکز بر تکنیک‌های Hard-negative Mining و Self-distillation منتشر شده بود.

تبدیل واژگان به فضای برداری

هر بردار امبدینگ در مدل SPLADE (کوتاه‌شده‌ی عبارت SParse Lexical AnD Expansion) یک فضای برداری ۳۰٬۵۲۲ بعدی برگرفته از واژگان WordPiece در مدل BERT را اشغال می‌کند. هر بعد نشان‌دهنده یکی از آیتم‌های واژگان، از جمله کلمات کامل، زیرکلمه‌ها (Subwords)، علائم نگارشی و توکن‌های ویژه است.

هد مدل زبانی پوشانده‌شده (Masked Language Model) در این مدل، واژگان را در هر موقعیت ورودی امتیازدهی می‌کند. سپس یک تبدیل نامنفی به همراه ادغام بیشینه (Max Pooling)، بالاترین امتیاز را برای هر آیتم حفظ کرده و یک بردار خلوت (Sparse Vector) وزن‌دار تولید می‌کند که اکثر ابعاد آن صفر هستند. این مدل می‌تواند به واژگانی که در متن اصلی غایب هستند نیز وزن اختصاص دهد؛ قابلیتی که فرایند گسترش معنایی خودکار برای پرس‌وجو و سند را فراهم می‌سازد.

محاسبه شباهت میان پرس‌وجو و سند با استفاده از ضرب داخلی انجام می‌شود:

score(query, document) = query_vector · document_vector

این امتیاز در واقع مجموع حاصل‌ضرب ابعاد مشترک واژگان میان بردار پرس‌وجو و بردار سند است. این ابعاد را می‌توان به‌صورت رکوردهای وزن‌دار در یک نمایه معکوس (Inverted Index) ذخیره کرد. چک‌پوینت مذکور بر پایه معماری BERT-base با حدود ۱۱۰ میلیون پارامتر بنا شده است؛ بنابراین حتی زمانی که عملیات بازیابی روی پردازنده‌های مرکزی (CPU) اجرا شود، کدگذاری پرس‌وجو همچنان نیازمند پردازش توسط یک مدل عصبی است.

تحلیل بنچمارک‌ها و نتایج ارزیابی

بنچمارک رتبه‌بندی بندهای متنی MS MARCO، توانایی بازیابی را بر روی حدود ۸٫۸ میلیون بند متنی وب با استفاده از پرس‌وجوهای استخراج‌شده از لاگ‌های جست‌وجوی Bing ارزیابی می‌کند. در صفحه رسمی این چک‌پوینت، نتایج زیر بر روی مجموعه توسعه (Development Set) ثبت شده است:

معیار
امتیاز
مفهوم
MRR@10
۳۷٫۶ (معادل ۰٫۳۷۶)
میزان نزدیکی اولین بند مرتبط در میان ۱۰ نتیجه اول

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر