شاهکار جدید کوهیر در ارزیابی هوش مصنوعی؛ داور هوشمندی که مچ بنچمارکهای سنتی را گرفت!
شرکت کوهیر با معرفی معیار نوین RCP-nDCG@10، سیستمهای سنتی ارزیابی در بازیابی اطلاعات و جستجوی معنایی را متحول کرد. این ابزار با بهرهگیری از یک داور هوش مصنوعی کالیبرهشده، اسناد ارزشمند جامانده در بنچمارکهای قدیمی را نجات میدهد و به زودی به لیدربورد معتبر MTEB اضافه خواهد شد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- شرکت کوهیر با معرفی روش ارزیابی جدید RCP-nDCG@10 و بهرهگیری از یک داور هوش مصنوعی کالیبرهشده، راهکاری پیدا کرده تا خطاهای فاحش بنچمارکهای بازیابی اطلاعات (Retrieval) را جبران کند.
- تستهای میدانی نشان دادند بنچمارکهای سنتی تا ۲۸ درصد از اسناد کاملاً مفید را نادیده میگرفتند؛ اما معیار جدید کوهیر در ۹۷ درصد از رقابتهای نزدیک، دقیقاً با نظر کارشناسان انسانی همعقیده بوده است.
- این ابزار نوآورانه که کدهای آن روی گیتهاب نیز منتشر شده، به زودی به لیدربورد مشهور MTEB ملحق میشود و تحولی بزرگ در سنجش سیستمهای RAG و مدلهای امبدینگ ایجاد خواهد کرد.
معیار جدید کوهیر برای عبور از بنچمارکهای تاریخگذشته
سیستمهای بازیابی اطلاعات برتر (Retrieval) این روزها در جدولهای ردهبندی با فاصلههای میلیمتری رقابت میکنند؛ طوری که واقعاً سخت است بفهمیم کدام سیستم پیشرفت واقعی داشته و کدام یک صرفاً خودش را با برچسبهای قدیمی و محدود یک بنچمارک هماهنگ کرده است. حالا شرکت کوهیر (Cohere) یک روش ارزیابی کاملاً نوآورانه به نام RCP-nDCG@10 ارائه داده و از همین روش برای بررسی و بهینهسازی مدلهای Embed 5 خود استفاده کرده است.
این معیار که مخفف عبارت Rubric-Calibrated Preferences nDCG@10 است، برای نمرهدهی به هر جفت «پرسش و سند» از یک داور هوش مصنوعی کالیبرهشده (LLM Judge) کمک میگیرد. این متد یک «دستورالعمل مشخص برای سنجش ارتباط» را با «مقایسه مستقیم میان اسناد بازیابیشده» پیوند میزند. کوهیر کدها و مجموعه دادههای این پروژه را هم به صورت عمومی منتشر کرده است.
وقتی پاسخنامههای قدیمی اسناد باارزش را نادیده میگیرند
معیار سنتی nDCG به سیستمهایی پاداش میدهد که مرتبطترین اسناد را در صدر فهرست نتایج بنشانند. نمرات این ارتباط معمولاً از مجموعهای به اسم qrels میآیند؛ قضاوتهای انسانی ثابتی که سالها پیش توسط ارزیابها روی اسناد استخراجشده از سیستمهای نسل قبلی شکل گرفته بودند.
مشکل اینجاست که اسناد خارج از آن پایگاه اولیه، بدون ارزیابی رها میشوند. در ساختارهای ارزیابی معمول، سندی که قبلاً داوری نشده حتی اگر پاسخ ایدهآل یک پرسش باشد، هیچ امتیازی نصیب سیستم نمیکند! به همین دلیل، موتورهای جستجو و بازیابی مدرنتر و قدرتمندتر فقط به این خاطر که اسناد مفید جدیدی پیدا میکنند که سیستمهای قدیمی جا انداخته بودند، امتیاز ارزشمند خود را از دست میدهند.
کوهیر برای اینکه ببیند این شکاف چقدر عمیق است، یک مطالعه میدانی با حضور ۴۶ ارزیاب انسانی انجام داد:
- ارزیابهای انسانی متوجه شدند ۲۸ درصد از اسنادی که توسط بنچمارکها برچسب «نامرتبط» خورده بودند، در واقع بسیار مفید و پاسخگو هستند! در مجموع، بنچمارکها تنها ۲۹ درصد اسناد را مرتبط میدانستند، در حالی که نگاه کارشناسان انسانی ۶۰ درصد اسناد را مرتبط تشخیص داد.
- معیارهای قدیمی qrels در پیشبینی نظر نهایی انسانها نمره AUC معادل ۰.۶۵ به دست آوردند (عددی که تفاوت چندانی با حدس تصادفی ۰.۵ ندارد)، در حالی که داور هوش مصنوعی کالیبرهشده به دقت خیرهکننده ۰.۹۱ رسید.
- وقتی دو ارزیاب انسانی مختلف یک سند یکسان را با مقیاس صفر تا چهار نمرهدهی میکردند، تنها در ۴۲ درصد مواقع به توافق کامل رسیدند که نشاندهنده اختلاف نظر بالای خود انسانهاست.
این قضاوتهای جاافتاده و اختلاف نظرهای انسانی سقف ارزیابی محدودی ساختهاند؛ به طوری که وقتی کیفیت مدلها از تفکیکپذیری این برچسبهای قدیمی فراتر میرود، فاصلههای ریز روی لیدربورد عملاً چیز زیادی درباره برتری واقعی یک مدل فاش نمیکنند.
معیار جدید RCP-nDCG@10 تأکید سنتی nDCG بر کیفیت رتبهبندی ۱۰ نتیجه اول را حفظ کرده، اما نمرات ثابت قدیمی را با دو سیگنال هوشمند جایگزین میکند:
- قضاوت بر اساس دستورالعمل (Rubric): مدل هوش مصنوعی به پنج پرسش مشخص با پاسخ بله یا خیر برای هر جفت پرسش و سند پاسخ میدهد تا یک سیگنال ارتباطی قطعی بسازد.
- ترجیحات میان اسناد: داور اسناد را به صورت دستهای بررسی کرده و برآورد میکند که هر سند چقدر شانس برتری بر بقیه را دارد.
- کالیبراسیون و همگامسازی: این روش سیگنالهای دستورالعمل و ترجیحات نسبی را با یکدیگر ترکیب کرده تا نمرات نهایی برای فرمول nDCG@10 محاسبه شوند.
دستورالعمل، نمرات پرسشهای گوناگون را روی یک خطکش مشترک نگه میدارد و همزمان سیگنال ترجیحی ترتیب اسناد شبیه به هم را تعیین میکند. این کالیبراسیون جلوی خطای مقایسهای را میگیرد؛ مشکلی که معمولاً وقتی رخ میدهد که یک LLM بخواهد بدون معیار ثابت به اسناد مختلف نمره دهد.
ارزیابهای انسانی روش جدید کوهیر را ترجیح میدهند
کوهیر این معیار را در ۲۸۹ مسابقه رودررو و بدون نام روی بنچمارکهای معروفی مثل NanoBEIR، BRIGHT و ViDoRe v3 تست کرد. سه ارزیاب انسانی هر مسابقه را بررسی کردند و برنده با رأی اکثریت تعیین شد:
- معیار RCP-nDCG@10 در ۷۷ درصد رقابتها دقیقاً سیستمی را انتخاب کرد که انسانها ترجیح میدادند؛ در حالی که nDCG معمولی تنها در ۵۲ درصد مسابقات با انسانها همعقیده بود.
- در مسابقاتی که دو معیار بر سر برنده با هم اختلاف داشتند، در ۷۰ درصد موارد حق با معیار RCP-nDCG@10 بود.
- در مقایسههایی که بیشترین اختلاف امتیاز ثبت شده بود، این معیار در ۹۷ درصد موارد با ارزیابها همراه بود، در حالی که معیار سنتی حتی در بزرگترین حاشیههای اختلاف هم فقط ۵۳ درصد تطابق داشت.
- از این ۲۵ درصد پیشرفت، ۱۹ واحد درصد آن مستقیماً به خاطر بازگرداندن امتیاز اسناد باارزشی بود که در سیستمهای قدیمی حذف شده بودند و ۶ واحد دیگر نیز به نمرهدهی تفکیکی دقیقتر برمیگشت.
کنت انوولدسن (Kenneth Enevoldsen)، نگهدارنده پروژه محبوب MTEB، اعلام کرده که این تیم قصد دارد RCP-nDCG@10 را به لیدربورد MTEB اضافه کند؛ تصمیمی که به خاطر سیگنالهای قویتر از دادههای فعلی و کاهش هزینههای اجرا گرفته شده است.
برای سنجش مدل Embed 5 به دو کارنامه مجزا نیاز است
مدل Embed 5 از این معیار نو به عنوان تارگت بهینهسازی استفاده کرده، بنابراین نتایج آن نیازمند درک دقیق مراحل بازیابی و معیارهای به کار رفته است. پکیج ارزیابی کوهیر شامل بازرتبهبندی، بازیابی اولیه، بازیابی چندوجهی و آزمونهای بین مدلی است.
نوع ارزیابی | چه چیزی را میسنجد؟ | معیار گزارششده |
|---|---|---|
بازرتبهبندی (Reranking) | مرتبسازی اسناد در یک مجموعه کاندیدای مشخص | RCP-nDCG@10 |
بازیابی مرحله اول (First-stage retrieval) | پیدا کردن کاندیداها از کل پایگاه داده و متون | nDCG و Recall استاندارد |
تستهای ترکیبی متن-تصویر، تصویر صفحه و چندمدلی | رتبهبندی در ورودیهای چندوجهی یا ورودیهای خاص مدل | nDCG@10 استاندارد |
جایگاه یک مدل در هر کدام از این آزمونها میتواند تغییر کند؛ زیرا هر آزمایش بخش متفاوتی از پایپلاین بازیابی را رصد میکند. بنابراین امتیازهای ردیفهای مختلف این جدول را نباید مستقیماً روبهروی یکدیگر گذاشت.
کوهیر در ارزیابی فایلهای PDF تجزیهشده، برای مدل Embed 5 امتیاز ۸۳.۴ را به ثبت رسانده است؛ در حالی که Gemini Embedding 2 امتیاز ۸۰.۸ و Voyage 4 Large امتیاز ۸۳.۶ را به دست آوردهاند؛ اعدادی که منحصراً به همین سناریوی خاص تعلق دارند.
این معیار دقیقاً کجای پایپلاین بازیابی قرار میگیرد؟
مخزن گیتهاب کوهیر کلیه کدها و دادههای لازم برای پیادهسازی این سیستم روی متون دلخواه را در دسترس همگان گذاشته است. مهمترین کاربردهای این رویکرد عبارتاند از:
- ارزیابی سیستمهای RAG سازمانی: تیمها بدون نیاز به تهیه پاسخنامههای دستی بسیار پرهزینه، میتوانند جفتهای پرسش و سند را نمرهدهی کنند.
- مقایسه مدلهای امبدینگ: سازمانها میتوانند مقایسهها را بر اساس اسناد، کوئریها و شاخصهای اختصاصی کسبوکار خود بسنجند.
- پایش افت کیفی مدلها (Regression): تیمهای فنی با رشد دادهها، میتوانند تغییرات ناشی از بخشبندی متون (Chunking) و بازرتبهبندی را رصد کنند.
این معیار کیفیت چیدمان را درون یک استخر کاندیدای از پیش تعیینشده میسنجد. بنابراین معیارهای بازیابی اولیه و Recall همچنان برای اطمینان از اینکه کاندیداها پیش از بازرتبهبندی درست استخراج شدهاند، غیرقابل جایگزین هستند.
تعیین مدل داور نیز نقش حساسی دارد. در پیادهسازیهای عملیاتی باید مدل داور، پرامپت، دستورالعمل و تنظیمات نمونهبرداری کاملاً قفل شوند، هزینهها ثبت گردند و بخشی از آرا با انسانها بازبینی شود. برای دادههای حساس شرکتی نیز داور باید کاملاً با ضوابط امنیتی سازمانی هماهنگ باشد.
تیم مدلسازی جستجوی کوهیر قرار است جزئیات فنی بیشتر این روش و نحوه استفاده از آن را در یک وبینار تخصصی ارائه دهد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

پیروزی خیرهکننده هوش مصنوعی در استراتگو؛ مدل Ataraxos بلوف زدن و فریب را هم یاد گرفت!
پژوهشگران با توسعه مدل هوش مصنوعی آتاراکسوس (Ataraxos) موفق شدند بهترین بازیکنان بازی رومیزی استراتگو را شکست دهند و بر چالش بزرگ اطلاعات پنهان غلبه کنند. این سیستم با یادگیری تقویتی و استفاده از الگوریتم دیپنش، توانایی بینظیری در ارزیابی ریسک، بلوف زدن و حفظ خونسردی از خود نشان میدهد. نتایج این دستاورد علمی گامی مهم در ارتقای قدرت تصمیمگیری استراتژیک هوش مصنوعی در شرایط نامشخص به شمار میرود.

میز کار مشترک انسان و ایجنتها؛ اوپنایآی با قابلیت جدید Space به میدان آمد
اوپنایآی با معرفی قابلیت جدیدی به نام Space، یک فضای کار مشترک طراحی کرده که در آن انسانها و ایجنتهای هوش مصنوعی میتوانند دوشادوش یکدیگر پروژهها را پیش ببرند و اسناد را ویرایش کنند. این ابزار تازه که جایگزین بخش Library در ChatGPT شده و رقیبی تازه برای گوگل درایو به شمار میرود، با اسناد تعاملی Pages شیوه جدیدی از کار تیمی با هوش مصنوعی را به نمایش میگذارد.

وقتی دولت آمریکا فروشنده هوش مصنوعی به دنیا میشود؛ پشتپرده رقابت با چین و بازاریابی برای غولهای فناوری
دولت آمریکا فراتر از قانونگذاری، آستینها را بالا زده تا در نقش فروشنده و حامی فناوریهای هوش مصنوعی شرکتهای سیلیکونولی در بازارهای جهانی ظاهر شود. براندون رمینگتون، مدیر مرکز ملی هوش مصنوعی آمریکا، در گفتگویی خواندنی پرده از استراتژی واشینگتن برای تسخیر بازار جهانی، رقابت نفسگیر با مدلهای ارزانقیمت چین و عبور از سد بروکراسی برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.