پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل چندوجهی جدید Jina؛ جستجوی صدا و تصویر بدون نیاز به ساخت مجدد امبدینگ‌های متنی!

انتشار:۱۸ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

شرکت Jina از مدل امبدینگ چندوجهی جدیدی به نام jina-embeddings-v5-omni-small رونمایی کرده که متن، تصویر، صدا و ویدیو را وارد یک فضای برداری مشترک می‌کند. بزرگ‌ترین مزیت این مدل هماهنگی کامل آن با نسخه متنی قبلی است؛ یعنی تیم‌های توسعه‌دهنده می‌توانند بدون نیاز به تغییر دیتابیس متنی موجود، قابلیت جستجوی مدیا را به سیستم‌های خود اضافه کنند. این راهکار خلاقانه هزینه‌ها و پیچیدگی پیاده‌سازی سیستم‌های RAG چندوجهی را به شکل چشمگیری کاهش می‌دهد.

مدل چندوجهی جدید Jina؛ جستجوی صدا و تصویر بدون نیاز به ساخت مجدد امبدینگ‌های متنی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • شرکت Jina مدل ۱.۷۴ میلیارد پارامتری jina-embeddings-v5-omni-small رو منتشر کرده که می‌تونه همزمان متن، عکس، فایل صوتی و فریم‌های ویدیو رو در یک فضای برداری مشترک تحلیل و جستجو کنه.
  • برگ برنده این مدل تطابق بیت‌به‌بیت امبدینگ‌های متنی اون با نسخه قبلیه؛ یعنی اگر قبلاً دیتابیس متنی ساختی، نیازی نیست دوباره هزینه‌ کنی و دیتابیس رو از اول بسازی، بلکه صاف می‌تونی سرچ عکس و صدا رو هم بهش وصل کنی!
  • این مدل با پشتیبانی از فرمت‌های متنوع مثل MP4، MP3، WAV و PDF و بهره‌گیری از آموزش ماتروشکا (Matryoshka)، به توسعه‌دهنده‌ها اجازه میده بدون افت شدید دقت، حجم ذخیره‌سازی و هزینه‌های جستجو رو حسابی کم کنن.

قابلیت جستجوی چندوجهی در Jina؛ بدون نیاز به ساخت دوباره امبدینگ‌های متنی

شرکت Jina به‌تازگی از مدل jina-embeddings-v5-omni-small رونمایی کرده است؛ یک مدل ۱.۷۴ میلیارد پارامتری که متن، تصویر، ویدیو و فایل‌های صوتی را درون یک فضای برداری یکپارچه نگاشت می‌کند. در این ساختار، داده‌هایی که مفهوم مشابه یا نزدیکی دارند در کنار هم قرار می‌گیرند و به این ترتیب امکان جستجوی چندوجهی نزدیک‌ترین همسایه (Cross-modal nearest-neighbor search) فراهم می‌شود. نکته شگفت‌انگیز اینجاست که امبدینگ‌های متنی این مدل، در صورت یکسان بودن تنظیمات پیکربندی و تسک‌ها، بیت‌به‌بیت با نسخه متنی قبلی یعنی v5 Text یکسان هستند؛ این یعنی تیم‌های فنی بدون دست زدن به بردارها و دیتابیس متنی موجود، می‌توانند به‌راحتی قابلیت جستجو با تصویر، صوت یا ویدیو را به سرویس خود اضافه کنند.

البته حفظ این سازگاری کامل نیازمند رعایت چند شرط ساده است: استفاده از نسخه معادل v5 Text، همان آداپتور تسک، نقش یکسان در کوئری یا داکیومنت و ابعاد خروجی برابر. اگر این شرایط برقرار باشد، یک سیستم بازیابی اطلاعات (RAG) که روی دیتابیس متنی v5 سوار شده، می‌تواند بلافاصله با دریافت یک عکس، کلیپ صوتی یا فایل ویدیویی، ایندکس فعلی خود را جستجو کند—بدون اینکه نیاز باشد ذره‌ای از دیتابیس غول‌پیکر متنی دوباره انکود یا امبد شود!

مشخصه فنی
مقدار
تعداد پارامترها
۱.۷۴ میلیارد
انواع ورودی (Modalities)
متن، تصویر، فریم‌های ویدیویی و فایل صوتی
اندازه اصلی بردار (Native vector size)
۱۰۲۴ بعد
طول متن ورودی (Context length)
۳۲٬۷۶۸ توکن
ابعاد قابل برش (Truncated sizes)
۳۲، ۶۴، ۱۲۸، ۲۵۶، ۵۱۲ یا ۷۶۸ بعد
مجوز استفاده (License)
CC BY-NC 4.0

این مدل از فرمت‌های بسیار متنوعی مثل .mp4، .wav، .mp3، .pdf، .jpg و .png پشتیبانی می‌کند. علاوه بر این، به لطف آموزش ماتروشکا (Matryoshka representation learning)، توسعه‌دهندگان می‌توانند صرفاً ابعاد ابتدایی هر بردار را ذخیره کنند تا در ازای افت ناچیزی در کیفیت بازیابی، هزینه‌های ذخیره‌سازی و سرعت پردازش را تا حد چشمگیری بهینه‌سازی نمایند.

انتخاب هدف و تسک مدل

  • بازیابی اطلاعات (Retrieval): جستجوی نامتقارن کوئری به داکیومنت و سیستم‌های RAG

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل
آخرین اخبار

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل

چه اتفاقی می‌افتد اگر به مدت یک ماه هر روز افکار، یادداشت‌ها و دغدغه‌های ذهنی‌تان را برای خودتان ایمیل کنید و بگذارید هوش مصنوعی جمینای به آن‌ها جواب دهد؟ این آزمایش تجربی نشان می‌دهد که دستیار هوش مصنوعی گوگل فراتر از پاسخ‌های اداری و کلیشه‌ای، چطور می‌تواند ابزاری غافلگیرکننده برای مرتب کردن شلوغی‌های ذهن و پیدا کردن زوایای پنهان کار‌های روزمره باشد.

۷ دقیقه مطالعه
۰
۱۸ مهر
دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
آخرین اخبار

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!

پس از دسته‌گل‌های اخیر مدل‌های هوش مصنوعی آنتروپیک و نفوذ ناخواسته آن‌ها به سامانه‌های دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعه‌دهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدل‌های خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

۴ دقیقه مطالعه
۰
۱۸ مهر
شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
آخرین اخبار

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!

استارتاپ پرایم اینتلکت در اقدامی شگفت‌انگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریم‌ورک پرایم ایجنت را ظرف دو هفته از تایپ‌اسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متن‌باز است.

۵ دقیقه مطالعه
۰
۱۸ مهر