رونمایی کوهیر از مدلهای Embed 5؛ ایندکس هوشمند اسناد با جستوجوی ۲.۴ برابر سریعتر
استارتاپ هوش مصنوعی کوهیر (Cohere) از نسل جدید مدلهای امبدینگ خود به نام Embed 5 در دو نسخه Pro و Fast رونمایی کرد. این مدلها به لطف بهرهمندی از یک فضای برداری مشترک، به توسعهدهندگان اجازه میدهند اسناد سنگین را با بالاترین کیفیت ایندکس کنند و سپس پرسشهای کاربران را با سرعتی ۲.۴ برابری و هزینهای بسیار کمتر پاسخ دهند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- کوهیر با عرضه Embed 5 یک ایده هوشمندانه پیاده کرده: این مدل در دو نسخه Pro (مخصوص ایندکس آفلاین اسناد با بالاترین کیفیت) و Fast (مخصوص پاسخدهی به پرسشهای زنده با ۲.۴ برابر سرعت بالاتر) عرضه شده که فضای برداری کاملاً مشترکی دارن.
- به لطف این فضای مشترک، توسعهدهندهها دیگه مجبور نیستن کل دیتابیس رو دوباره از اول بسازن؛ اسناد رو با نسخه Pro ذخیره میکنن و پرسشهای کاربران یا ایجنتها رو با هزینه و تاخیر بسیار کمتر با نسخه Fast جواب میدن.
- بررسیها نشون میده نسخه Pro حتی از مدل text-embedding-3-large اوپنایآی هم بهتر عمل کرده و جالبتر این که کوهیر بیشترین جهش چندزبانه این مدل نسبت به نسل قبل رو در زبان فارسی (با ۱۳ امتیاز رشد) ثبت کرده است.
مدل Embed 5 کوهیر: ترکیب ایندکس باکیفیت با جستوجوی فوقسریع
شرکت کوهیر (Cohere) از خانواده مدلهای امبدینگ جدید خود به نام Embed 5 در دو نسخه با بردارهای کاملاً سازگار رونمایی کرد. نسخه Embed 5 Pro به طور ویژه برای ارتقای کیفیت بازیابی در زمان ایندکس آفلاین اسناد و متون طراحی شده است؛ در حالی که نسخه Embed 5 Fast با تمرکز روی کمترین تاخیر و بالاترین توان پردازشی، گزینهای بینقص برای جستوجوی تعاملی و حلقههای کاری ایجنتها به شمار میرود. از آنجا که هر دو مدل از یک فضای برداری (Embedding Space) مشترک استفاده میکنند، توسعهدهندگان میتوانند اسناد خود را با نسخه Pro ایندکس کنند و سپس پرسشهای کاربران را با نسخه Fast پاسخ دهند، بدون اینکه نیازی به بازسازی مجدد ایندکس برداری باشد.
مدلهای امبدینگ وظیفه دارند متن، تصویر و انواع محتوا را به بردارهای عددی تبدیل کنند؛ بردارهایی که فاصله و نزدیکی آنها به یکدیگر نشاندهنده شباهت معنایی میان محتواهاست. سیستمهای بازیابی اطلاعات (Retrieval) با مقایسه این بردارها، اسناد مرتبط را پیدا میکنند. به این ترتیب، ایده فضای مشترک در Embed 5 باعث میشود مدلی که برای بارگذاری و ذخیره اولیه اسناد استفاده میشود از مدلی که پاسخگوی درخواستهای کاربران است کاملاً تفکیک شود. کوهیر جزئیات فنی این مدلها را در یادداشتهای انتشار رسمی خود تشریح کرده است.
یک فضای برداری مشترک، دو کاربرد متفاوت
قابلیت | Embed 5 Pro | Embed 5 Fast |
|---|---|---|
کاربرد اصلی | ایندکس آفلاین با کیفیت فوقالعاده بالا | جستوجو با تاخیر کم و توان پردازشی بالا |
قیمت رسمی در API | ۰.۱۲ دلار به ازای هر یک میلیون توکن | ۰.۰۸ دلار به ازای هر یک میلیون توکن |
توان پردازشی گزارششده | حدود ۱۶۰ سند در ثانیه | حدود ۳۷۷ سند در ثانیه |
فرمتهای ورودی | متن، تصویر و ورودیهای ترکیبی متن و تصویر مثل صفحات PDF | |
زبانهای پشتیبانیشده | بیش از ۱۰۰ زبان مختلف | |
پنجره زمینهای (Context Window) | ۱۲۸٬۰۰۰ توکن | |
ابعاد خروجی | ۲۵۶، ۵۱۲، ۷۶۸، ۱۰۲۴، ۱۵۳۶ و ۲۰۴۸ | |
انواع داده خروجی | اعشاری (Float)، عدد صحیح ۸ بیتی (int8) و باینری (Binary) |
هر دو نسخه از امبدینگهای ماتروشکا (Matryoshka Embeddings) پشتیبانی میکنند؛ قابلیتی که به برنامهها اجازه میدهد در صورتی که صرفهجویی در فضای ذخیرهسازی مهمتر از حداکثر کیفیت بازیابی باشد، بردارهای کوتاهشده را ذخیره کنند. البته برای بازیابی متقابل میان دو مدل (Cross-model retrieval)، باید مسیرهای ایندکسگذاری و جستوجو از ابعاد خروجی یکسان و فرمت پشتیبانیشده توسط پایگاه داده برداری استفاده کنند.
مدلهای Embed 5 از طریق API کوهیر، پلتفرم Microsoft Foundry، سرویس Amazon SageMaker و Model Vault برای استقرار در محیطهای اختصاصی (Single-tenant) در دسترس هستند. قیمتهای اعلامشده بر حسب توکن مربوط به استفاده از API است و هزینههای میزبانی ابری اختصاصی بر اساس شرایط هر پلتفرم محاسبه میشود.
بنچمارکهای ارائهشده: برتری چشمگیر نسخه Pro
طبق گزارش کوهیر، مدل Embed 5 Pro در بنچمارک ViDoRe V3 (که به طور ویژه برای ارزیابی اسناد سازمانی پیچیده با دادههای بصری طراحی شده) میانگین امتیاز ۸۵.۸ را به دست آورده است. این شرکت امتیاز Embed 5 Fast را ۸۴.۷، مدل Voyage 4 Large را ۸۳.۷، مدل Gemini Embedding 2 را ۸۳.۲ و مدل text-embedding-3-large شرکت اوپنایآی (OpenAI) را ۷۵.۵ اعلام کرده است.
مدل | امتیاز ViDoRe V3 |
|---|---|
Embed 5 Pro | ۸۵.۸ |
Embed 5 Fast | ۸۴.۷ |
Voyage 4 Large | ۸۳.۷ |
Gemini Embedding 2 | ۸۳.۲ |
OpenAI text-embedding-3-large | ۷۵.۵ |
در آزمونهای متمرکز بر حوزه مالی، پیشتازی نسخه Pro حتی محسوستر است. این مدل در بنچمارک FinanceBench امتیاز ۸۰.۱، در FinQA امتیاز ۹۰.۰ و در ViDoRe V3 Finance امتیاز ۸۵.۰ را ثبت کرده و نسخه Fast در هر سه آزمون در جایگاه دوم ایستاده است. جالب اینکه امتیاز نسخه Pro در بنچمارک FinanceBench حدود ۲۱.۴ امتیاز از رقیب سرشناس خود یعنی مدل اوپنایآی بالاتر است. علاوه بر این، کوهیر گزارش داده که در مقایسه با نسل قبلی (Embed 4)، بیشترین جهش عملکرد چندزبانه این مدل در زبان فارسی با ۱۳ امتیاز رشد، زبان تلوگو با ۱۲ امتیاز و زبان هندی با ۱۲ امتیاز رشد حاصل شده است.
البته این آمارها حاصل ارزیابیهای درونسازمانی کوهیر هستند و باید آنها را در کنار تستهای متناسب با حجم کاری واقعی سنجید؛ چرا که کیفیت نهایی بازیابی به فاکتورهایی مثل نحوه قطعهبندی متون (Chunking)، ساختار اسناد، ترکیب زبانها، شیوه پرسشوجو، مرحله بازرتبهبندی (Reranking) و تنظیمات شباهت پایگاه داده برداری بستگی دارد.
استراتژی بازیابی میانمدلی؛ برگ برنده کوهیر
کوهیر عملکرد ترکیب مدلهای مختلف را برای ثبت سند و جستوجوی پرسش در ۴۰ دیتاست توسعه بررسی کرده است. طبق اعلام این شرکت، عملکرد حالت ترکیبی (ایندکس با یک مدل و جستوجو با مدلی دیگر) تنها بین ۱.۶ تا ۲.۷ درصد کمتر از حالتی است که هر دو مرحله با همان مدل اصلی انجام شود.
این نتیجه زمینه را برای یک معماری دو مرحلهای فوقالعاده جذاب فراهم میکند: تمام اسناد و پایگاه داده خود را فقط یک بار با نسخه Pro با نهایت کیفیت ایندکس کنید، و سپس پرسشهای لحظهای کاربران را با نسخه Fast انکود و جستوجو نمایید. با این ترفند، مرحله ذخیرهسازی دادهها از دقت بالای Pro بهرهمند میشود و پاسخدهی مکرر به درخواستها با سرعت بالاتر و هزینه بسیار کمتر Fast صورت میگیرد. آزمایشهای کوهیر نشان میدهد که در طولهای معمول متن، توان پردازشی Fast به طور میانگین ۲.۴ برابر Pro است (حدود ۳۷۷ سند در ثانیه در برابر ۱۶۰ سند در ثانیه).
البته تاخیر واقعی به عواملی چون طول ورودی، دستهبندی دادهها (Batching)، موقعیت جغرافیایی، سربار شبکه و سختافزار سرورها بستگی دارد؛ بنابراین تیمهای فنی بهتر است به جای اتکا به اعداد خام، زمان کلی پاسخدهی را در سیستمهای خود اندازه بگیرند.
حل چالش برچسبهای ناقص با روش ارزیابی جدید RCP-nDCG
کوهیر برای بهینهسازی Embed 5 از روش ارزیابی ویژهای به نام RCP-nDCG@10 استفاده کرده که هدف آن حل مشکل برچسبهای ناقص در دیتاستها است. معیار سنتی nDCG نتایج رتبهبندیشده را با یک کلید پاسخ ثابت مقایسه میکند؛ بنابراین اگر سندی مرتبط باشد اما در کلید پاسخ ثبت نشده باشد، سیستم بازیابی بابت پیدا کردن آن هیچ امتیازی دریافت نمیکند.
در بررسی کوهیر با مشارکت ۴۶ ارزیاب انسانی، برچسبهای بنچمارکهای موجود در پیشبینی قضاوت انسانها به دقت (AUC) برابر با ۰.۶۵ رسیدند؛ در حالی که یک مدل زبانی بزرگ کالیبرهشده به عنوان داور توانست به دقت ۰.۹۱ دست پیدا کند. جالب اینجاست که ارزیابهای انسانی ۲۸ درصد از اسنادی را که بنچمارکها «نامرتبط» دانسته بودند، در واقع مفید تشخیص دادند!
معیار RCP-nDCG@10 با بهرهگیری از یک داور هوش مصنوعی تنظیمشده، یک فرمول ارزیابی یکپارچه را روی تمام اسناد بازیابیشده اعمال میکند. در مقایسههای زوجی بین سیستمها، این معیار در ۷۷ درصد موارد سیستمی را برگزید که داوران انسانی نیز آن را ترجیح داده بودند (در مقایسه با ۵۲ درصد برای nDCG سنتی). همین لحاظ کردن اسناد مرتبط جاافتاده در کلید پاسخ، باعث ارتقای ۱۹ امتیازی شد.
کوهیر کدها و دادههای این روش را در گیتهاب منتشر کرده است. با این حال، نتایج همچنان به مدل داور و دادههای کالیبراسیون وابسته هستند و ممکن است مدلهای بهینهشده با این معیار، در لیدربوردهای سنتی nDCG رتبههای متفاوتی کسب کنند.
کاهش حجم بردارها تا ۳۲ بایت؛ صرفهجویی چشمگیر در هزینهها
در پروژههای بزرگ با حجم دیتای سنگین، هزینه ذخیرهسازی بردارها حتی میتواند از هزینه اینفرنس مدل امبدینگ هم فراتر برود! مدل Embed 5 با ترکیب ابعاد قابل انتخاب و فرمتهای خروجی با دقت پایینتر، گزینههای ذخیرهسازی متنوعی را در اختیار تیمها میگذارد:
- بردار ۲۰۴۸ بعدی float32: معادل ۸ کیلوبایت برای هر بردار
- بردار ۱۰۲۴ بعدی int8: معادل ۱ کیلوبایت برای هر بردار
- بردار ۲۵۶ بعدی باینری (Binary): تنها ۳۲ بایت برای هر بردار
برای یک مجموعه شامل ۱۰۰ میلیون چانک (قطعه متنی)، این فرمتها به ترتیب به حدود ۸۱۹ گیگابایت، ۱۰۲ گیگابایت و تنها ۳.۲ گیگابایت فضای ذخیرهسازی خام نیاز دارند. فشردهترین حالت یعنی ۲۵۶ بعدی باینری، دقیقاً ۲۵۶ برابر کوچکتر از حالت ۲۰۴۸ بعدی float32 فضا اشغال میکند! البته متادیتاهای ایندکس، ساختارهای گراف، نسخههای پشتیبان و سربار دیتابیس نیز به این حجم خام افزوده میشوند.
کوهیر فرمت ۱۰۲۴ بعدی int8 را به عنوان تعادلی عالی میان حجم ذخیرهسازی و کیفیت بازیابی پیشنهاد میکند و میگوید عملکرد آن در هر دو مدل تقریباً با حالت اعشاری (Float) برابری میکند. البته پشتیبانی دیتابیسها از این فرمتها متفاوت است و سیستم شما باید توان ذخیره و مقایسه فرمت انتخابی را داشته باشد.
ایندکس با Pro، جستوجو با Fast؛ نمونه کد پیادهسازی
کتابخانه پایتون کوهیر دسترسی به هر دو مدل را از طریق یک متد واحد فراهم کرده است. در نمونه کد زیر، متد امبدینگ با ابعاد یکسان و خروجی اعشاری اجرا شده و نوع ورودی بازیابی به شکل مناسب مشخص شده است:
import os
import cohere
co = cohere.ClientV2(api_key=os.environ["CO_API_KEY"])
documents = co.embed(
model="embed-v5.0-pro",
input_type="search_document",
texts=["Net interest margin narrowed 12 bps to 2.61%."],
output_dimension=1024,
embedding_types=["float"],
)
query = co.embed(
model="embed-v5.0-fast",
input_type="search_query",
texts=["How did net interest margin change?"],
output_dimension=1024,
embedding_types=["float"],
)
document_vector = documents.embeddings.float_[0]
query_vector = query.embeddings.float_[0]در این فرآیند، بردار سند وارد ایندکس پایگاه داده میشود و بردار پرسش در لحظه ارسال درخواست کاربر، با بردارهای ذخیرهشده مقایسه میگردد. البته خطوط لوله (پایپلاینهای) موجود بازیابی باید ابعاد یکسان، فرمت خروجی و پیکربندی شباهت مشابه را در هر دو مسیر حفظ نمایند.
سیستمهای RAG که با فایلهای PDF، گزارشهای مالی، تصاویر یا متون چندزبانه کار میکنند، میتوانند از مدل Pro برای ایندکسگذاریهای زمانبر و از مدل Fast برای جستوجوهای مکرر کاربران بهره ببرند. وجود این فضای برداری مشترک، دردسر امبدینگ مجدد را به کل از بین برده و بدون نیاز به ذخیره نسخه دوم از ایندکس، سرعت جابهجایی میان مدلها را به حداکثر میرساند.
مطالب مرتبط و پیشنهادی

آپدیت هیجانانگیز ویرایشگر Zed: انتخاب مدل هوش مصنوعی برای هر سابایجنت حین کدنویسی!
ویرایشگر محبوب Zed در نسخه ۱.۲۲ سیستم چندایجنت (Multi-Agent) خود را به سطحی کاملاً تازه برده است. در این بهروزرسانی، ایجنت اصلی میتواند به دلخواه خود برای هر سابایجنت یک مدل مجزا تعیین کند تا هزینه و سرعت توسعه به شکل چشمگیری بهینهسازی شود. همچنین با اضافه شدن فشردهسازی خودکار کانتکست، پردازش وظایف طولانی و پیچیده بدون وقفه انجام خواهد شد.

درگاه Monid متنباز شد؛ دسترسی ایجنتهای هوش مصنوعی به بیش از ۲۰۰۰ ابزار فقط با یک API
پلتفرم Monid درگاه یکپارچه ابزارهای هوش مصنوعی خود را در گیتهاب متنباز کرد تا ایجنتها بتوانند تنها با یک کلید API به بیش از ۲۰۰۰ ابزار کاربردی از ۷۲ ارائهدهنده متصل شوند. این پروژه همانند پلتفرم OpenRouter عمل میکند، با این تفاوت که به جای مدلهای زبانی، دسترسی ایجنتها به ابزارهای وب، منابع داده و سرویسهای تولید محتوا را در قالب یک درگاه واحد مدیریت میکند.

ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!
شرکت متا با یک ترفند حسابداری زیرکانه و ثبت رکهای سرور هوش مصنوعی به عنوان «تجهیزات آزمایشی»، توانسته معافیت مالیاتی پژوهشی خود را به رقم سرسامآور ۳.۹ میلیارد دلار برساند. کارشناسان مالیاتی این اقدام را از نظر قانونی بسیار پرریسک و مشکوک میدانند، اما در صورت تأیید، راه برای معافیتهای مالیاتی نجومی سایر غولهای هوش مصنوعی نیز هموار خواهد شد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.