پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار تازه گوگل دیپ‌مایند برای گوشی‌ها: جست‌وجوی هوشمند صدا، تصویر و ویدیو با مدل EmbeddingGemma 2

انتشار:۱۴ مهر ۱۴۰۵(۲ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

گوگل دیپ‌مایند از مدل EmbeddingGemma 2 رونمایی کرد؛ یک مدل امبدینگ چندوجهی و سبک با ۷۴۰ میلیون پارامتر که پردازش هم‌زمان متن، صدا، تصویر و ویدیو را مستقیماً روی گوشی‌های هوشمند ممکن می‌سازد. این ابزار کاربردی با اجرای کاملاً آفلاین و اشغال کم‌تر از ۶۰۰ مگابایت رم، ضمن حفظ کامل حریم خصوصی کاربران، سرعت بازیابی و جست‌وجوی هوشمند اطلاعات را متحول می‌کند.

شاهکار تازه گوگل دیپ‌مایند برای گوشی‌ها: جست‌وجوی هوشمند صدا، تصویر و ویدیو با مدل EmbeddingGemma 2

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • گوگل دیپ‌مایند مدل امبدینگ جدید EmbeddingGemma 2 را با ۷۴۰ میلیون پارامتر معرفی کرد که متن، عکس، صدا و فریم‌های ویدیو را بدون نیاز به اینترنت و مستقیماً روی گوشی هوشمند پردازش می‌کند.
  • این مدل با مصرف کم‌تر از ۶۰۰ مگابایت رم، در بنچمارک بازیابی کد جهشی نزدیک به ۱۰ امتیاز ثبت کرده و امکان جست‌وجوی بین‌حوزه‌ای (مثلاً پیدا کردن یک ویدیو بر اساس وویس صوتی) را فراهم می‌آورد.
  • به لطف معماری ماژولار و تکنیک هوشمند ماتریوشکا، توسعه‌دهندگان می‌توانند ابعاد بردارها را تا ۶ برابر کوچک‌تر کنند و ابزار‌های جست‌وجوی بسیار سریع، سبک و کاملاً خصوصی بسازند.

ورود بازیابی چندوجهی به دستگاه‌های شخصی با EmbeddingGemma 2

تیم گوگل دیپ‌مایند (Google DeepMind) به‌تازگی مدل EmbeddingGemma 2 را منتشر کرده است؛ یک مدل امبدینگ جمع‌وجور با ۷۴۰ میلیون پارامتر که می‌تواند انواع محتوا از متن و تصویر گرفته تا صدا و ویدیو را مستقیماً روی سخت‌افزارهای معمولی پردازش کند. گوگل این مدل را نخستین مدل امبدینگ ذاتاً چندوجهی (Natively Multimodal) خود نامیده که به طور ویژه برای جست‌وجوهای بین‌حوزه‌ای (Cross-Modal) طراحی شده است؛ برای مثال، می‌توانید با یک وویس یا فایل صوتی در میان ویدیوها جست‌وجو کنید یا با یک عبارت متنی ساده، یک قطعه صوتی خاص را بیرون بکشید.

مدل‌های امبدینگ داده‌ها را به بردارهای عددی تبدیل می‌کنند تا مواردی که از نظر معنایی به هم نزدیک‌اند، در کنار یکدیگر قرار بگیرند. حالا اگر این فرایند سنگین به‌جای فضای ابری، مستقیماً روی خودِ دستگاه انجام شود، تأخیر شبکه به صفر می‌رسد، امکان جست‌وجوی کاملاً آفلاین فراهم می‌شود و مهم‌تر از همه، اطلاعات و فایل‌های شخصی شما هرگز از دستگاه خارج نخواهند شد.

نسخه قبلی این خانواده، یعنی EmbeddingGemma 1 که فقط متن را می‌شناخت، با استقبال کم‌نظیری بیش از ۲۰ میلیون بار دانلود شد. حالا نسل دوم آن با اضافه کردن سه رمزگذار (انکودر) اختیاری برای انواع محتوا آمده و بااین‌حال، تعداد پارامترهایش همچنان زیر یک میلیارد باقی مانده است؛ مرز طلایی و کاربردی برای اجرا روی گوشی‌ها و لپ‌تاپ‌هایی با حافظه رم محدود.

۷۴۰ میلیون پارامتر؛ بارگذاری هوشمند بسته به نیاز شما

مشخصات فنی
EmbeddingGemma 2
معماری
Gemma 4
لایسنس (مجوز)
Apache 2.0
تعداد پارامترها
در مجموع ۷۴۰ میلیون: ۲۷۰ میلیون برای متن، ۱۷۰ میلیون برای تصویر و ۳۰۰ میلیون برای صدا
اندازه بردارها
۱۲۸، ۲۵۶، ۵۱۲ یا ۷۶۸ بُعد
پنجره زمینه (Context Window)
۸ هزار توکن (۴ برابر مدل EmbeddingGemma 1)
ظرفیت تقریبی در هر مرحله
۵.۵ دقیقه فایل صوتی، ۲۹ تصویر یا ۵۸ فریم ویدیو
مصرف رم گزارش‌شده روی پیکسل
حدود ۱۹۱ مگابایت برای وزن‌های کوانتیزه‌شده متن و ۵۶۷ مگابایت برای مدل کامل چندوجهی روی Pixel 11 Pro

طراحی ماژولار این مدل دست توسعه‌دهندگان را حسابی باز گذاشته است؛ برنامه‌ها می‌توانند تنها بخش متنی ۲۷۰ میلیون پارامتری را لود کنند یا در صورت نیاز، انکودرهای تصویر و صدا را هم به آن اضافه نمایند. البته باید در نظر داشت که در دنیای واقعی، با اضافه شدن محیط اجرا (Runtime)، لایه‌های فعال‌سازی، ایندکس برداری و داده‌های ورودی، مصرف نهایی رم کمی بالا‌تر از این اعداد پایه خواهد بود.

بردهایی که بعد از آموزش هم کوچک می‌شوند!

گوگل با استفاده از تکنیک یادگیری بازنمایی ماتریوشکا (Matryoshka Representation Learning)، ابتدای هر بردار خروجی را طوری آموزش داده که به تنهایی هم کاملاً کارآمد و مستقل باشد. به این ترتیب، توسعه‌دهندگان می‌توانند در زمان اجرای مدل (Inference)، بردار ۷۶۸ بُعدی را بدون نیاز به آموزش مجدد مدل، به ابعاد ۵۱۲، ۲۵۶ یا حتی ۱۲۸ بُعد کوتاه کنند و با کم‌ترین افت دقت در بازیابی، حافظه و رم بسیار کمتری مصرف نمایند.

برای درک بهتر این موضوع جالب است بدانید که در دقت ۳۲ بیتی، ذخیره یک میلیون بردار ۷۶۸ بُعدی خام به حدود ۳.۱ گیگابایت فضا نیاز دارد؛ اما وقتی آن‌ها را به ۱۲۸ بُعد کاهش دهید، این عدد پیش از هزینه‌های جانبی پایگاه داده برداری به حدود ۵۱۲ مگابایت می‌رسد؛ یعنی یک کاهش حجم شگفت‌انگیز ۶ برابری!

جهش چشمگیر در بازیابی و جست‌وجوی کد

طبق گزارش گوگل، مدل EmbeddingGemma 2 نه‌تنها قدرت نسخه قبلی را در درک متون چندزبانه حفظ کرده، بلکه در بنچمارک معتبر MTEB Code امتیاز خود را از ۶۸.۷۶ به ۷۸.۶۸ رسانده است. بنچمارک MTEB یا همان Massive Text Embedding Benchmark، توانایی مدل‌های امبدینگ را در کار‌هایی مثل بازیابی، خوشه‌بندی و دسته‌بندی می‌سنجد.

نتیجه بنچمارک MTEB Code
امتیاز
EmbeddingGemma 1
۶۸.۷۶
EmbeddingGemma 2
۷۸.۶۸
میزان ارتقا
۹.۹۲ امتیاز

این پیشرفت قابل توجه، مدل جدید را به گزینه‌ای بی‌نقص برای جست‌وجوی محلی کدها و استفاده در ایجنت‌های کدنویسی تبدیل می‌کند. علاوه بر این، گوگل تأکید کرده که در میان مدل‌های زیر ۱ میلیارد پارامتر، این مدل در ارزیابی‌های مربوط به تصویر، ویدیو، سند و صدا بالا‌ترین کیفیت به ازای هر پارامتر را ارائه می‌دهد و حتی از برخی مدل‌های تخصصی با ابعاد دو برابر بزرگ‌تر نیز عملکرد بهتری به جا گذاشته است.

البته باید توجه داشت که امتیاز بنچمارک‌ها به نوع مجموعه داده، پیش‌پردازش، ابعاد بردار و تنظیمات کوانتیزه‌سازی بستگی دارد؛ بنابراین برای استقرار در محیط واقعی، بررسی عملکرد روی سخت‌افزار مقصد ضروری است. مدل‌های امبدینگ غول‌پیکرتر هنوز هم دقت بالاتری ثبت می‌کنند و پیکربندی چندوجهی کامل این مدل نیز پیش از احتساب منابع خودِ اپلیکیشن، بیش از نیم گیگابایت از رم فعال دستگاه را اشغال می‌نماید.

یک پشته نرم‌افزاری یکپارچه برای بازیابی و تولید محتوا

در روش تولید مبتنی بر بازیابی یا همان RAG، سیستم ابتدا درون یک ایندکس برداری به دنبال داده‌های مرتبط می‌گردد و سپس نتایج را به یک مدل مولد می‌سپارد. جالب اینجاست که EmbeddingGemma 2 از توکنایزر متنی و انکودر صوتی مشترک با Gemma 4 بهره می‌برد؛ بنابراین پلتفرم‌های سازگار می‌توانند از این بخش‌ها هم‌زمان برای هر دو فرایند بازیابی و تولید محتوا استفاده کنند.

استفاده مجدد از این مؤلفه‌های مشترک، حجم کل رم مورد نیاز خط لوله RAG روی گوشی را به شدت کاهش می‌دهد؛ قابلیتی که به‌ویژه برای برنامه‌هایی که در فایل‌های صوتی جست‌وجو کرده و سپس پاسخ تولید می‌کنند، یک مزیت طلایی است. البته میزان این صرفه‌جویی به این بستگی دارد که محیط اجرای انتخابی، بخش‌های مدل را به اشتراک بگذارد یا از هر کدام نسخه‌ای مجزا لود کند.

گوگل چند نمونه برنامه کاربردی مرجع را نیز در گالری Google AI Edge منتشر کرده است: برنامه Instant Media Search که آیتم‌های رسانه‌ای را از طریق متن یا تصویر پیدا می‌کند، ابزار Video Moments Finder که لحظات و بخش‌های خاصی از ویدیو را بر اساس متن یا صدا جست‌وجو می‌نماید، و اپلیکیشن Google AI Edge Foresight که ترکیب EmbeddingGemma 2 و Gemma 4 را برای استدلال متنی به نمایش می‌گذارد.

مسیرهای استقرار و استفاده در پروژه‌ها

وزن‌های مدل در حال حاضر از طریق پلتفرم‌های هاگینگ فیس (Hugging Face) و کگل (Kaggle) در دسترس است. گوگل اعلام کرده که پشتیبانی از آن به‌زودی به بخش Model Garden پلتفرم ابری سازمانی جمینای نیز اضافه خواهد شد.

  • استنتاج عمومی (General Inference): پشتیبانی از ابزار‌های محبوب Transformers، Sentence Transformers، MLX، vLLM، llama.cpp، SGLang، Ollama و LM Studio
  • استقرار روی دستگاه (Edge Deployment): استفاده از MediaPipe برای تسک‌های بازیابی آماده و LiteRT برای پیاده‌سازی‌های سفارشی
  • تست مستقیم در مرورگر: نسخه آزمایشی آنلاین از طریق دموی WebGPU
  • تنظیم دقیق (Fine-Tuning): راهنمای رسمی منتشرشده در مستندات Unsloth

بازیابی محلی کجا ارزش واقعی خود را نشان می‌دهد؟

برنامه‌هایی که با اطلاعات حساس و محرمانه، شرایط آفلاین یا حساس به تأخیر سروکار دارند، می‌توانند با کمک EmbeddingGemma 2 فرایند بازیابی را در نزدیک‌ترین نقطه ممکن به مبدأ داده انجام دهند. سناریوهای کاربردی این مدل شامل موارد زیر است:

  1. جست‌وجوی معنایی پیشرفته میان یادداشت‌ها، عکس‌ها، اسناد و وویس‌های ذخیره‌شده روی گوشی یا رایانه
  2. بازیابی و کاوش محلی در کدهای پروژه برای ایجنت‌های کدنویسی روی لپ‌تاپ
  3. جست‌وجوی بین‌حوزه‌ای (Cross-modal)؛ مانند پیدا کردن دقیق لحظه‌ای از ویدیو که جمله‌ای خاص در آن بیان شده است
  4. دسته‌بندی و مسیریابی روی دستگاه با استفاده از MediaPipe Decision Task API

بازیابی ابری همچنان برای سناریوهایی که داده‌ها از قبل روی سرور قرار دارند و مسائلی مثل تأخیر شبکه، دسترسی آفلاین و حریم خصوصی اولویت اصلی نیستند، انتخاب مناسبی است. اما برای اپلیکیشن‌های موبایل و دسکتاپ که مستقیماً روی محتوای شخصی کاربران فعالیت می‌کنند، مؤلفه‌های مشترک این مدل با Gemma 4، قابلیت تغییر ابعاد بردارها و مصرف حافظه کم‌تر از ۶۰۰ مگابایت، برگ برنده‌ای تمام‌عیار به شمار می‌رود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگ‌ها در هر محیط کدنویسی!
آخرین اخبار

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگ‌ها در هر محیط کدنویسی!

ابزار امنیتی محبوب VulnHunter که توسط شرکت Capital One توسعه یافته بود، با یک فورک جامعه‌محور تازه از انحصار محیط Claude Code رها شد. این ابزار متن‌باز با رویکرد هکرهای واقعی کدهای پروژه را اسکن می‌کند و حالا توسعه‌دهندگان می‌توانند ایجنت‌ها و اسکیل‌های آن را در هر محیط کدنویسی دلخواهی برای کشف و رفع تضمینی آسیب‌پذیری‌ها به کار بگیرند.

۲ دقیقه مطالعه
۰
۱۴ مهر
متا ابزار Rebalancer را متن‌باز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها
آخرین اخبار

متا ابزار Rebalancer را متن‌باز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها

متا پس از ۹ سال استفاده داخلی، کتابخانه اختصاصی Rebalancer را به‌صورت متن‌باز در اختیار عموم توسعه‌دهندگان قرار داد. این ابزار قدرتمند روزانه بیش از ۴۰ میلیون مسئله پیچیده تخصیص منابع و چیدمان سخت‌افزار را در زیرساخت‌های عظیم این شرکت حل‌وفصل می‌کند. انتشار این پروژه همراه با ابزار بصری Explorer، مدیریت دیتاسنترها و سرور‌های توزیع‌شده را برای تیم‌های فنی متحول خواهد کرد.

۶ دقیقه مطالعه
۰
۱۴ مهر
کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپی‌پیست!
آخرین اخبار

کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپی‌پیست!

شرکت آنتروپیک نسخه بتای عمومی Claude for Workspace را عرضه کرد تا کاربران بتوانند چت‌بات کلود را مستقیماً داخل گوگل داکس، شیتس و اسلایدز به کار بگیرند. با این قابلیت، بدون نیاز به کپی‌پیست مداوم میان تب‌های مختلف مرورگر، می‌توانید متن‌ها را در لحظه اصلاح کنید، در شیتس فرمول بسازید و اسلایدهای حرفه‌ای طراحی کنید.

۴ دقیقه مطالعه
۰
۱۴ مهر