مدل چندوجهی جدید Jina؛ جستجوی صدا و تصویر بدون نیاز به ساخت مجدد امبدینگهای متنی!
شرکت Jina از مدل امبدینگ چندوجهی جدیدی به نام jina-embeddings-v5-omni-small رونمایی کرده که متن، تصویر، صدا و ویدیو را وارد یک فضای برداری مشترک میکند. بزرگترین مزیت این مدل هماهنگی کامل آن با نسخه متنی قبلی است؛ یعنی تیمهای توسعهدهنده میتوانند بدون نیاز به تغییر دیتابیس متنی موجود، قابلیت جستجوی مدیا را به سیستمهای خود اضافه کنند. این راهکار خلاقانه هزینهها و پیچیدگی پیادهسازی سیستمهای RAG چندوجهی را به شکل چشمگیری کاهش میدهد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- شرکت Jina مدل ۱.۷۴ میلیارد پارامتری jina-embeddings-v5-omni-small رو منتشر کرده که میتونه همزمان متن، عکس، فایل صوتی و فریمهای ویدیو رو در یک فضای برداری مشترک تحلیل و جستجو کنه.
- برگ برنده این مدل تطابق بیتبهبیت امبدینگهای متنی اون با نسخه قبلیه؛ یعنی اگر قبلاً دیتابیس متنی ساختی، نیازی نیست دوباره هزینه کنی و دیتابیس رو از اول بسازی، بلکه صاف میتونی سرچ عکس و صدا رو هم بهش وصل کنی!
- این مدل با پشتیبانی از فرمتهای متنوع مثل MP4، MP3، WAV و PDF و بهرهگیری از آموزش ماتروشکا (Matryoshka)، به توسعهدهندهها اجازه میده بدون افت شدید دقت، حجم ذخیرهسازی و هزینههای جستجو رو حسابی کم کنن.
قابلیت جستجوی چندوجهی در Jina؛ بدون نیاز به ساخت دوباره امبدینگهای متنی
شرکت Jina بهتازگی از مدل jina-embeddings-v5-omni-small رونمایی کرده است؛ یک مدل ۱.۷۴ میلیارد پارامتری که متن، تصویر، ویدیو و فایلهای صوتی را درون یک فضای برداری یکپارچه نگاشت میکند. در این ساختار، دادههایی که مفهوم مشابه یا نزدیکی دارند در کنار هم قرار میگیرند و به این ترتیب امکان جستجوی چندوجهی نزدیکترین همسایه (Cross-modal nearest-neighbor search) فراهم میشود. نکته شگفتانگیز اینجاست که امبدینگهای متنی این مدل، در صورت یکسان بودن تنظیمات پیکربندی و تسکها، بیتبهبیت با نسخه متنی قبلی یعنی v5 Text یکسان هستند؛ این یعنی تیمهای فنی بدون دست زدن به بردارها و دیتابیس متنی موجود، میتوانند بهراحتی قابلیت جستجو با تصویر، صوت یا ویدیو را به سرویس خود اضافه کنند.
البته حفظ این سازگاری کامل نیازمند رعایت چند شرط ساده است: استفاده از نسخه معادل v5 Text، همان آداپتور تسک، نقش یکسان در کوئری یا داکیومنت و ابعاد خروجی برابر. اگر این شرایط برقرار باشد، یک سیستم بازیابی اطلاعات (RAG) که روی دیتابیس متنی v5 سوار شده، میتواند بلافاصله با دریافت یک عکس، کلیپ صوتی یا فایل ویدیویی، ایندکس فعلی خود را جستجو کند—بدون اینکه نیاز باشد ذرهای از دیتابیس غولپیکر متنی دوباره انکود یا امبد شود!
مشخصه فنی | مقدار |
|---|---|
تعداد پارامترها | ۱.۷۴ میلیارد |
انواع ورودی (Modalities) | متن، تصویر، فریمهای ویدیویی و فایل صوتی |
اندازه اصلی بردار (Native vector size) | ۱۰۲۴ بعد |
طول متن ورودی (Context length) | ۳۲٬۷۶۸ توکن |
ابعاد قابل برش (Truncated sizes) | ۳۲، ۶۴، ۱۲۸، ۲۵۶، ۵۱۲ یا ۷۶۸ بعد |
مجوز استفاده (License) | CC BY-NC 4.0 |
این مدل از فرمتهای بسیار متنوعی مثل .mp4، .wav، .mp3، .pdf، .jpg و .png پشتیبانی میکند. علاوه بر این، به لطف آموزش ماتروشکا (Matryoshka representation learning)، توسعهدهندگان میتوانند صرفاً ابعاد ابتدایی هر بردار را ذخیره کنند تا در ازای افت ناچیزی در کیفیت بازیابی، هزینههای ذخیرهسازی و سرعت پردازش را تا حد چشمگیری بهینهسازی نمایند.
انتخاب هدف و تسک مدل
- بازیابی اطلاعات (Retrieval): جستجوی نامتقارن کوئری به داکیومنت و سیستمهای RAG
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل
چه اتفاقی میافتد اگر به مدت یک ماه هر روز افکار، یادداشتها و دغدغههای ذهنیتان را برای خودتان ایمیل کنید و بگذارید هوش مصنوعی جمینای به آنها جواب دهد؟ این آزمایش تجربی نشان میدهد که دستیار هوش مصنوعی گوگل فراتر از پاسخهای اداری و کلیشهای، چطور میتواند ابزاری غافلگیرکننده برای مرتب کردن شلوغیهای ذهن و پیدا کردن زوایای پنهان کارهای روزمره باشد.

دستهگلهای جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
پس از دستهگلهای اخیر مدلهای هوش مصنوعی آنتروپیک و نفوذ ناخواسته آنها به سامانههای دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعهدهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدلهای خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
استارتاپ پرایم اینتلکت در اقدامی شگفتانگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریمورک پرایم ایجنت را ظرف دو هفته از تایپاسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متنباز است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.