پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار جدید کوهیر در ارزیابی هوش مصنوعی؛ داور هوشمندی که مچ بنچمارک‌های سنتی را گرفت!

انتشار:۱۱ مهر ۱۴۰۵(۳ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

شرکت کوهیر با معرفی معیار نوین RCP-nDCG@10، سیستم‌های سنتی ارزیابی در بازیابی اطلاعات و جستجوی معنایی را متحول کرد. این ابزار با بهره‌گیری از یک داور هوش مصنوعی کالیبره‌شده، اسناد ارزشمند جامانده در بنچمارک‌های قدیمی را نجات می‌دهد و به زودی به لیدربورد معتبر MTEB اضافه خواهد شد.

شاهکار جدید کوهیر در ارزیابی هوش مصنوعی؛ داور هوشمندی که مچ بنچمارک‌های سنتی را گرفت!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • شرکت کوهیر با معرفی روش ارزیابی جدید RCP-nDCG@10 و بهره‌گیری از یک داور هوش مصنوعی کالیبره‌شده، راهکاری پیدا کرده تا خطاهای فاحش بنچمارک‌های بازیابی اطلاعات (Retrieval) را جبران کند.
  • تست‌های می‌دانی نشان دادند بنچمارک‌های سنتی تا ۲۸ درصد از اسناد کاملاً مفید را نادیده می‌گرفتند؛ اما معیار جدید کوهیر در ۹۷ درصد از رقابت‌های نزدیک، دقیقاً با نظر کارشناسان انسانی هم‌عقیده بوده است.
  • این ابزار نوآورانه که کدهای آن روی گیتهاب نیز منتشر شده، به زودی به لیدربورد مشهور MTEB ملحق می‌شود و تحولی بزرگ در سنجش سیستم‌های RAG و مدل‌های امبدینگ ایجاد خواهد کرد.

معیار جدید کوهیر برای عبور از بنچمارک‌های تاریخ‌گذشته

سیستم‌های بازیابی اطلاعات برتر (Retrieval) این روز‌ها در جدول‌های رده‌بندی با فاصله‌های میلی‌متری رقابت می‌کنند؛ طوری که واقعاً سخت است بفهمیم کدام سیستم پیشرفت واقعی داشته و کدام یک صرفاً خودش را با برچسب‌های قدیمی و محدود یک بنچمارک هماهنگ کرده است. حالا شرکت کوهیر (Cohere) یک روش ارزیابی کاملاً نوآورانه به نام RCP-nDCG@10 ارائه داده و از همین روش برای بررسی و بهینه‌سازی مدل‌های Embed 5 خود استفاده کرده است.

این معیار که مخفف عبارت Rubric-Calibrated Preferences nDCG@10 است، برای نمره‌دهی به هر جفت «پرسش و سند» از یک داور هوش مصنوعی کالیبره‌شده (LLM Judge) کمک می‌گیرد. این متد یک «دستورالعمل مشخص برای سنجش ارتباط» را با «مقایسه مستقیم میان اسناد بازیابی‌شده» پیوند می‌زند. کوهیر کدها و مجموعه داده‌های این پروژه را هم به صورت عمومی منتشر کرده است.

وقتی پاسخ‌نامه‌های قدیمی اسناد باارزش را نادیده می‌گیرند

معیار سنتی nDCG به سیستم‌هایی پاداش می‌دهد که مرتبط‌ترین اسناد را در صدر فهرست نتایج بنشانند. نمرات این ارتباط معمولاً از مجموعه‌ای به اسم qrels می‌آیند؛ قضاوت‌های انسانی ثابتی که سال‌ها پیش توسط ارزیاب‌ها روی اسناد استخراج‌شده از سیستم‌های نسل قبلی شکل گرفته بودند.

مشکل اینجاست که اسناد خارج از آن پایگاه اولیه، بدون ارزیابی رها می‌شوند. در ساختارهای ارزیابی معمول، سندی که قبلاً داوری نشده حتی اگر پاسخ ایده‌آل یک پرسش باشد، هیچ امتیازی نصیب سیستم نمی‌کند! به همین دلیل، موتورهای جستجو و بازیابی مدرن‌تر و قدرتمندتر فقط به این خاطر که اسناد مفید جدیدی پیدا می‌کنند که سیستم‌های قدیمی جا انداخته بودند، امتیاز ارزشمند خود را از دست می‌دهند.

کوهیر برای این‌که ببیند این شکاف چقدر عمیق است، یک مطالعه می‌دانی با حضور ۴۶ ارزیاب انسانی انجام داد:

  • ارزیاب‌های انسانی متوجه شدند ۲۸ درصد از اسنادی که توسط بنچمارک‌ها برچسب «نامرتبط» خورده بودند، در واقع بسیار مفید و پاسخ‌گو هستند! در مجموع، بنچمارک‌ها تنها ۲۹ درصد اسناد را مرتبط می‌دانستند، در حالی که نگاه کارشناسان انسانی ۶۰ درصد اسناد را مرتبط تشخیص داد.
  • معیارهای قدیمی qrels در پیش‌بینی نظر نهایی انسان‌ها نمره AUC معادل ۰.۶۵ به دست آوردند (عددی که تفاوت چندانی با حدس تصادفی ۰.۵ ندارد)، در حالی که داور هوش مصنوعی کالیبره‌شده به دقت خیره‌کننده ۰.۹۱ رسید.
  • وقتی دو ارزیاب انسانی مختلف یک سند یکسان را با مقیاس صفر تا چهار نمره‌دهی می‌کردند، تنها در ۴۲ درصد مواقع به توافق کامل رسیدند که نشان‌دهنده اختلاف نظر بالای خود انسان‌هاست.

این قضاوت‌های جاافتاده و اختلاف نظرهای انسانی سقف ارزیابی محدودی ساخته‌اند؛ به طوری که وقتی کیفیت مدل‌ها از تفکیک‌پذیری این برچسب‌های قدیمی فراتر می‌رود، فاصله‌های ریز روی لیدربورد عملاً چیز زیادی درباره برتری واقعی یک مدل فاش نمی‌کنند.

معیار جدید RCP-nDCG@10 تأکید سنتی nDCG بر کیفیت رتبه‌بندی ۱۰ نتیجه اول را حفظ کرده، اما نمرات ثابت قدیمی را با دو سیگنال هوشمند جایگزین می‌کند:

  1. قضاوت بر اساس دستورالعمل (Rubric): مدل هوش مصنوعی به پنج پرسش مشخص با پاسخ بله یا خیر برای هر جفت پرسش و سند پاسخ می‌دهد تا یک سیگنال ارتباطی قطعی بسازد.
  2. ترجیحات میان اسناد: داور اسناد را به صورت دسته‌ای بررسی کرده و برآورد می‌کند که هر سند چقدر شانس برتری بر بقیه را دارد.
  3. کالیبراسیون و همگام‌سازی: این روش سیگنال‌های دستورالعمل و ترجیحات نسبی را با یکدیگر ترکیب کرده تا نمرات نهایی برای فرمول nDCG@10 محاسبه شوند.

دستورالعمل، نمرات پرسش‌های گوناگون را روی یک خط‌کش مشترک نگه می‌دارد و هم‌زمان سیگنال ترجیحی ترتیب اسناد شبیه به هم را تعیین می‌کند. این کالیبراسیون جلوی خطای مقایسه‌ای را می‌گیرد؛ مشکلی که معمولاً وقتی رخ می‌دهد که یک LLM بخواهد بدون معیار ثابت به اسناد مختلف نمره دهد.

ارزیاب‌های انسانی روش جدید کوهیر را ترجیح می‌دهند

کوهیر این معیار را در ۲۸۹ مسابقه رودررو و بدون نام روی بنچمارک‌های معروفی مثل NanoBEIR، BRIGHT و ViDoRe v3 تست کرد. سه ارزیاب انسانی هر مسابقه را بررسی کردند و برنده با رأی اکثریت تعیین شد:

  • معیار RCP-nDCG@10 در ۷۷ درصد رقابت‌ها دقیقاً سیستمی را انتخاب کرد که انسان‌ها ترجیح می‌دادند؛ در حالی که nDCG معمولی تنها در ۵۲ درصد مسابقات با انسان‌ها هم‌عقیده بود.
  • در مسابقاتی که دو معیار بر سر برنده با هم اختلاف داشتند، در ۷۰ درصد موارد حق با معیار RCP-nDCG@10 بود.
  • در مقایسه‌هایی که بیش‌ترین اختلاف امتیاز ثبت شده بود، این معیار در ۹۷ درصد موارد با ارزیاب‌ها همراه بود، در حالی که معیار سنتی حتی در بزرگ‌ترین حاشیه‌های اختلاف هم فقط ۵۳ درصد تطابق داشت.
  • از این ۲۵ درصد پیشرفت، ۱۹ واحد درصد آن مستقیماً به خاطر بازگرداندن امتیاز اسناد باارزشی بود که در سیستم‌های قدیمی حذف شده بودند و ۶ واحد دیگر نیز به نمره‌دهی تفکیکی دقیق‌تر برمی‌گشت.

کنت انوولدسن (Kenneth Enevoldsen)، نگهدارنده پروژه محبوب MTEB، اعلام کرده که این تیم قصد دارد RCP-nDCG@10 را به لیدربورد MTEB اضافه کند؛ تصمیمی که به خاطر سیگنال‌های قوی‌تر از داده‌های فعلی و کاهش هزینه‌های اجرا گرفته شده است.

برای سنجش مدل Embed 5 به دو کارنامه مجزا نیاز است

مدل Embed 5 از این معیار نو به عنوان تارگت بهینه‌سازی استفاده کرده، بنابراین نتایج آن نیازمند درک دقیق مراحل بازیابی و معیارهای به کار رفته است. پکیج ارزیابی کوهیر شامل بازرتبه‌بندی، بازیابی اولیه، بازیابی چندوجهی و آزمون‌های بین مدلی است.

نوع ارزیابی
چه چیزی را می‌سنجد؟
معیار گزارش‌شده
بازرتبه‌بندی (Reranking)
مرتب‌سازی اسناد در یک مجموعه کاندیدای مشخص
RCP-nDCG@10
بازیابی مرحله اول (First-stage retrieval)
پیدا کردن کاندیداها از کل پایگاه داده و متون
nDCG و Recall استاندارد
تست‌های ترکیبی متن-تصویر، تصویر صفحه و چندمدلی
رتبه‌بندی در ورودی‌های چندوجهی یا ورودی‌های خاص مدل
nDCG@10 استاندارد

جایگاه یک مدل در هر کدام از این آزمون‌ها می‌تواند تغییر کند؛ زیرا هر آزمایش بخش متفاوتی از پایپ‌لاین بازیابی را رصد می‌کند. بنابراین امتیازهای ردیف‌های مختلف این جدول را نباید مستقیماً روبه‌روی یکدیگر گذاشت.

کوهیر در ارزیابی فایل‌های PDF تجزیه‌شده، برای مدل Embed 5 امتیاز ۸۳.۴ را به ثبت رسانده است؛ در حالی که Gemini Embedding 2 امتیاز ۸۰.۸ و Voyage 4 Large امتیاز ۸۳.۶ را به دست آورده‌اند؛ اعدادی که منحصراً به همین سناریوی خاص تعلق دارند.

این معیار دقیقاً کجای پایپ‌لاین بازیابی قرار می‌گیرد؟

مخزن گیتهاب کوهیر کلیه کدها و داده‌های لازم برای پیاده‌سازی این سیستم روی متون دلخواه را در دسترس همگان گذاشته است. مهم‌ترین کاربردهای این رویکرد عبارت‌اند از:

  1. ارزیابی سیستم‌های RAG سازمانی: تیم‌ها بدون نیاز به تهیه پاسخ‌نامه‌های دستی بسیار پرهزینه، می‌توانند جفت‌های پرسش و سند را نمره‌دهی کنند.
  2. مقایسه مدل‌های امبدینگ: سازمان‌ها می‌توانند مقایسه‌ها را بر اساس اسناد، کوئری‌ها و شاخص‌های اختصاصی کسب‌وکار خود بسنجند.
  3. پایش افت کیفی مدل‌ها (Regression): تیم‌های فنی با رشد داده‌ها، می‌توانند تغییرات ناشی از بخش‌بندی متون (Chunking) و بازرتبه‌بندی را رصد کنند.

این معیار کیفیت چیدمان را درون یک استخر کاندیدای از پیش تعیین‌شده می‌سنجد. بنابراین معیارهای بازیابی اولیه و Recall همچنان برای اطمینان از این‌که کاندیداها پیش از بازرتبه‌بندی درست استخراج شده‌اند، غیرقابل جایگزین هستند.

تعیین مدل داور نیز نقش حساسی دارد. در پیاده‌سازی‌های عملیاتی باید مدل داور، پرامپت، دستورالعمل و تنظیمات نمونه‌برداری کاملاً قفل شوند، هزینه‌ها ثبت گردند و بخشی از آرا با انسان‌ها بازبینی شود. برای داده‌های حساس شرکتی نیز داور باید کاملاً با ضوابط امنیتی سازمانی هماهنگ باشد.

تیم مدلسازی جستجوی کوهیر قرار است جزئیات فنی بیش‌تر این روش و نحوه استفاده از آن را در یک وبینار تخصصی ارائه دهد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

پیروزی خیره‌کننده هوش مصنوعی در استراتگو؛ مدل Ataraxos بلوف زدن و فریب را هم یاد گرفت!
آخرین اخبار

پیروزی خیره‌کننده هوش مصنوعی در استراتگو؛ مدل Ataraxos بلوف زدن و فریب را هم یاد گرفت!

پژوهشگران با توسعه مدل هوش مصنوعی آتاراکسوس (Ataraxos) موفق شدند بهترین بازیکنان بازی رومیزی استراتگو را شکست دهند و بر چالش بزرگ اطلاعات پنهان غلبه کنند. این سیستم با یادگیری تقویتی و استفاده از الگوریتم دیپ‌نش، توانایی بی‌نظیری در ارزیابی ریسک، بلوف زدن و حفظ خونسردی از خود نشان می‌دهد. نتایج این دستاورد علمی گامی مهم در ارتقای قدرت تصمیم‌گیری استراتژیک هوش مصنوعی در شرایط نامشخص به شمار می‌رود.

۵ دقیقه مطالعه
۰
۱۱ مهر
میز کار مشترک انسان و ایجنت‌ها؛ اوپن‌ای‌آی با قابلیت جدید Space به میدان آمد
آخرین اخبار

میز کار مشترک انسان و ایجنت‌ها؛ اوپن‌ای‌آی با قابلیت جدید Space به میدان آمد

اوپن‌ای‌آی با معرفی قابلیت جدیدی به نام Space، یک فضای کار مشترک طراحی کرده که در آن انسان‌ها و ایجنت‌های هوش مصنوعی می‌توانند دوشادوش یکدیگر پروژه‌ها را پیش ببرند و اسناد را ویرایش کنند. این ابزار تازه که جایگزین بخش Library در ChatGPT شده و رقیبی تازه برای گوگل درایو به شمار می‌رود، با اسناد تعاملی Pages شیوه جدیدی از کار تیمی با هوش مصنوعی را به نمایش می‌گذارد.

۴ دقیقه مطالعه
۰
۱۱ مهر
وقتی دولت آمریکا فروشنده هوش مصنوعی به دنیا می‌شود؛ پشت‌پرده رقابت با چین و بازاریابی برای غول‌های فناوری
آخرین اخبار

وقتی دولت آمریکا فروشنده هوش مصنوعی به دنیا می‌شود؛ پشت‌پرده رقابت با چین و بازاریابی برای غول‌های فناوری

دولت آمریکا فراتر از قانون‌گذاری، آستین‌ها را بالا زده تا در نقش فروشنده و حامی فناوری‌های هوش مصنوعی شرکت‌های سیلیکون‌ولی در بازارهای جهانی ظاهر شود. براندون رمینگتون، مدیر مرکز ملی هوش مصنوعی آمریکا، در گفتگویی خواندنی پرده از استراتژی واشینگتن برای تسخیر بازار جهانی، رقابت نفس‌گیر با مدل‌های ارزان‌قیمت چین و عبور از سد بروکراسی برمی‌دارد.

۷ دقیقه مطالعه
۰
۱۱ مهر