مدل SPLADE شرکت Naver با عبور از ۸۷۸ هزار دانلود در Hugging Face خبرساز شد
مدل بازیابی متنی splade-cocondenser-selfdistil متعلق به آزمایشگاه Naver Labs با ثبت بیش از ۸۷۸ هزار دانلود در پلتفرم Hugging Face، بار دیگر در کانون توجه توسعهدهندگان سیستمهای RAG قرار گرفت. این مدل با تلفیق گسترش معنایی یادگیریشده و نمایهسازی معکوس، گزینهای قدرتمند برای ارتقای دقت جستوجوی متنی به شمار میرود.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل بازیابی اطلاعات splade-cocondenser-selfdistil توسعهیافته توسط Naver Labs با عبور از مرز ۸۷۸ هزار دانلود در Hugging Face در میان مدلهای ترند قرار گرفت.
- این مدل بر پایه معماری BERT با ۱۱۰ میلیون پارامتر، بردارهای اسپارس ۳۰٬۵۲۲ بعدی متناظر با واژگان WordPiece تولید میکند و واژگان غایب در متن را برای بهبود جستوجو گسترش میدهد.
- امتیاز شباهت در SPLADE از طریق ضرب داخلی محاسبه شده و در بنچمارک MS MARCO به معیار MRR@10 معادل ۳۷٫۶ درصد دست یافته است.
- اگرچه آمار دانلود در پلتفرم Hugging Face لزوماً به معنای استقرار گسترده در محیط پروداکشن نیست، اما نشاندهنده توجه روزافزون به بازیابی متنی اسپارس در معماریهای RAG است.
چرا مدل بازیابی SPLADE متعلق به Naver دوباره ترند شده است؟
پلتفرم Hugging Face اخیراً چکپوینت splade-cocondenser-selfdistil متعلق به Naver Labs را در فهرست مدلهای ترند خود قرار داده و شمارنده عمومی آن از مرز ۸۷۸ هزار دانلود عبور کرده است. این مدل به سیستمهای مبتنیبر هوش مصنوعی مولد با قابلیت بازیابی دانش (RAG)، امکان گسترش معنایی یادگیریشده، وزندهی شفاف و قابلبررسی به توکنها و جستوجوی بهینه با فهرست معکوس (Posting List) را میدهد.
شمارندههای پلتفرم Hugging Face تعداد درخواستهای فایل را ثبت میکنند که شامل دانلودهای تکراری، کشها و فرایندهای خودکار نیز میشود؛ بنابراین این رقم نشاندهنده استقرار منحصربهفرد این مدل در محیطهای عملیاتی نیست. با این حال، این حجم از توجه بار دیگر نگاهها را به یک استاندارد شناختهشده در حوزه بازیابی اسپارس (Sparse Retrieval) معطوف کرده است که در پژوهشهای سال ۲۰۲۲ با تمرکز بر تکنیکهای Hard-negative Mining و Self-distillation منتشر شده بود.
تبدیل واژگان به فضای برداری
هر بردار امبدینگ در مدل SPLADE (کوتاهشدهی عبارت SParse Lexical AnD Expansion) یک فضای برداری ۳۰٬۵۲۲ بعدی برگرفته از واژگان WordPiece در مدل BERT را اشغال میکند. هر بعد نشاندهنده یکی از آیتمهای واژگان، از جمله کلمات کامل، زیرکلمهها (Subwords)، علائم نگارشی و توکنهای ویژه است.
هد مدل زبانی پوشاندهشده (Masked Language Model) در این مدل، واژگان را در هر موقعیت ورودی امتیازدهی میکند. سپس یک تبدیل نامنفی به همراه ادغام بیشینه (Max Pooling)، بالاترین امتیاز را برای هر آیتم حفظ کرده و یک بردار خلوت (Sparse Vector) وزندار تولید میکند که اکثر ابعاد آن صفر هستند. این مدل میتواند به واژگانی که در متن اصلی غایب هستند نیز وزن اختصاص دهد؛ قابلیتی که فرایند گسترش معنایی خودکار برای پرسوجو و سند را فراهم میسازد.
محاسبه شباهت میان پرسوجو و سند با استفاده از ضرب داخلی انجام میشود:
score(query, document) = query_vector · document_vectorاین امتیاز در واقع مجموع حاصلضرب ابعاد مشترک واژگان میان بردار پرسوجو و بردار سند است. این ابعاد را میتوان بهصورت رکوردهای وزندار در یک نمایه معکوس (Inverted Index) ذخیره کرد. چکپوینت مذکور بر پایه معماری BERT-base با حدود ۱۱۰ میلیون پارامتر بنا شده است؛ بنابراین حتی زمانی که عملیات بازیابی روی پردازندههای مرکزی (CPU) اجرا شود، کدگذاری پرسوجو همچنان نیازمند پردازش توسط یک مدل عصبی است.
تحلیل بنچمارکها و نتایج ارزیابی
بنچمارک رتبهبندی بندهای متنی MS MARCO، توانایی بازیابی را بر روی حدود ۸٫۸ میلیون بند متنی وب با استفاده از پرسوجوهای استخراجشده از لاگهای جستوجوی Bing ارزیابی میکند. در صفحه رسمی این چکپوینت، نتایج زیر بر روی مجموعه توسعه (Development Set) ثبت شده است:
معیار | امتیاز | مفهوم |
|---|---|---|
MRR@10 | ۳۷٫۶ (معادل ۰٫۳۷۶) | میزان نزدیکی اولین بند مرتبط در میان ۱۰ نتیجه اول |
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.