شاهکار تازه گوگل دیپمایند برای گوشیها: جستوجوی هوشمند صدا، تصویر و ویدیو با مدل EmbeddingGemma 2
گوگل دیپمایند از مدل EmbeddingGemma 2 رونمایی کرد؛ یک مدل امبدینگ چندوجهی و سبک با ۷۴۰ میلیون پارامتر که پردازش همزمان متن، صدا، تصویر و ویدیو را مستقیماً روی گوشیهای هوشمند ممکن میسازد. این ابزار کاربردی با اجرای کاملاً آفلاین و اشغال کمتر از ۶۰۰ مگابایت رم، ضمن حفظ کامل حریم خصوصی کاربران، سرعت بازیابی و جستوجوی هوشمند اطلاعات را متحول میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- گوگل دیپمایند مدل امبدینگ جدید EmbeddingGemma 2 را با ۷۴۰ میلیون پارامتر معرفی کرد که متن، عکس، صدا و فریمهای ویدیو را بدون نیاز به اینترنت و مستقیماً روی گوشی هوشمند پردازش میکند.
- این مدل با مصرف کمتر از ۶۰۰ مگابایت رم، در بنچمارک بازیابی کد جهشی نزدیک به ۱۰ امتیاز ثبت کرده و امکان جستوجوی بینحوزهای (مثلاً پیدا کردن یک ویدیو بر اساس وویس صوتی) را فراهم میآورد.
- به لطف معماری ماژولار و تکنیک هوشمند ماتریوشکا، توسعهدهندگان میتوانند ابعاد بردارها را تا ۶ برابر کوچکتر کنند و ابزارهای جستوجوی بسیار سریع، سبک و کاملاً خصوصی بسازند.
ورود بازیابی چندوجهی به دستگاههای شخصی با EmbeddingGemma 2
تیم گوگل دیپمایند (Google DeepMind) بهتازگی مدل EmbeddingGemma 2 را منتشر کرده است؛ یک مدل امبدینگ جمعوجور با ۷۴۰ میلیون پارامتر که میتواند انواع محتوا از متن و تصویر گرفته تا صدا و ویدیو را مستقیماً روی سختافزارهای معمولی پردازش کند. گوگل این مدل را نخستین مدل امبدینگ ذاتاً چندوجهی (Natively Multimodal) خود نامیده که به طور ویژه برای جستوجوهای بینحوزهای (Cross-Modal) طراحی شده است؛ برای مثال، میتوانید با یک وویس یا فایل صوتی در میان ویدیوها جستوجو کنید یا با یک عبارت متنی ساده، یک قطعه صوتی خاص را بیرون بکشید.
مدلهای امبدینگ دادهها را به بردارهای عددی تبدیل میکنند تا مواردی که از نظر معنایی به هم نزدیکاند، در کنار یکدیگر قرار بگیرند. حالا اگر این فرایند سنگین بهجای فضای ابری، مستقیماً روی خودِ دستگاه انجام شود، تأخیر شبکه به صفر میرسد، امکان جستوجوی کاملاً آفلاین فراهم میشود و مهمتر از همه، اطلاعات و فایلهای شخصی شما هرگز از دستگاه خارج نخواهند شد.
نسخه قبلی این خانواده، یعنی EmbeddingGemma 1 که فقط متن را میشناخت، با استقبال کمنظیری بیش از ۲۰ میلیون بار دانلود شد. حالا نسل دوم آن با اضافه کردن سه رمزگذار (انکودر) اختیاری برای انواع محتوا آمده و بااینحال، تعداد پارامترهایش همچنان زیر یک میلیارد باقی مانده است؛ مرز طلایی و کاربردی برای اجرا روی گوشیها و لپتاپهایی با حافظه رم محدود.
۷۴۰ میلیون پارامتر؛ بارگذاری هوشمند بسته به نیاز شما
مشخصات فنی | EmbeddingGemma 2 |
|---|---|
معماری | Gemma 4 |
لایسنس (مجوز) | Apache 2.0 |
تعداد پارامترها | در مجموع ۷۴۰ میلیون: ۲۷۰ میلیون برای متن، ۱۷۰ میلیون برای تصویر و ۳۰۰ میلیون برای صدا |
اندازه بردارها | ۱۲۸، ۲۵۶، ۵۱۲ یا ۷۶۸ بُعد |
پنجره زمینه (Context Window) | ۸ هزار توکن (۴ برابر مدل EmbeddingGemma 1) |
ظرفیت تقریبی در هر مرحله | ۵.۵ دقیقه فایل صوتی، ۲۹ تصویر یا ۵۸ فریم ویدیو |
مصرف رم گزارششده روی پیکسل | حدود ۱۹۱ مگابایت برای وزنهای کوانتیزهشده متن و ۵۶۷ مگابایت برای مدل کامل چندوجهی روی Pixel 11 Pro |
طراحی ماژولار این مدل دست توسعهدهندگان را حسابی باز گذاشته است؛ برنامهها میتوانند تنها بخش متنی ۲۷۰ میلیون پارامتری را لود کنند یا در صورت نیاز، انکودرهای تصویر و صدا را هم به آن اضافه نمایند. البته باید در نظر داشت که در دنیای واقعی، با اضافه شدن محیط اجرا (Runtime)، لایههای فعالسازی، ایندکس برداری و دادههای ورودی، مصرف نهایی رم کمی بالاتر از این اعداد پایه خواهد بود.
بردهایی که بعد از آموزش هم کوچک میشوند!
گوگل با استفاده از تکنیک یادگیری بازنمایی ماتریوشکا (Matryoshka Representation Learning)، ابتدای هر بردار خروجی را طوری آموزش داده که به تنهایی هم کاملاً کارآمد و مستقل باشد. به این ترتیب، توسعهدهندگان میتوانند در زمان اجرای مدل (Inference)، بردار ۷۶۸ بُعدی را بدون نیاز به آموزش مجدد مدل، به ابعاد ۵۱۲، ۲۵۶ یا حتی ۱۲۸ بُعد کوتاه کنند و با کمترین افت دقت در بازیابی، حافظه و رم بسیار کمتری مصرف نمایند.
برای درک بهتر این موضوع جالب است بدانید که در دقت ۳۲ بیتی، ذخیره یک میلیون بردار ۷۶۸ بُعدی خام به حدود ۳.۱ گیگابایت فضا نیاز دارد؛ اما وقتی آنها را به ۱۲۸ بُعد کاهش دهید، این عدد پیش از هزینههای جانبی پایگاه داده برداری به حدود ۵۱۲ مگابایت میرسد؛ یعنی یک کاهش حجم شگفتانگیز ۶ برابری!
جهش چشمگیر در بازیابی و جستوجوی کد
طبق گزارش گوگل، مدل EmbeddingGemma 2 نهتنها قدرت نسخه قبلی را در درک متون چندزبانه حفظ کرده، بلکه در بنچمارک معتبر MTEB Code امتیاز خود را از ۶۸.۷۶ به ۷۸.۶۸ رسانده است. بنچمارک MTEB یا همان Massive Text Embedding Benchmark، توانایی مدلهای امبدینگ را در کارهایی مثل بازیابی، خوشهبندی و دستهبندی میسنجد.
نتیجه بنچمارک MTEB Code | امتیاز |
|---|---|
EmbeddingGemma 1 | ۶۸.۷۶ |
EmbeddingGemma 2 | ۷۸.۶۸ |
میزان ارتقا | ۹.۹۲ امتیاز |
این پیشرفت قابل توجه، مدل جدید را به گزینهای بینقص برای جستوجوی محلی کدها و استفاده در ایجنتهای کدنویسی تبدیل میکند. علاوه بر این، گوگل تأکید کرده که در میان مدلهای زیر ۱ میلیارد پارامتر، این مدل در ارزیابیهای مربوط به تصویر، ویدیو، سند و صدا بالاترین کیفیت به ازای هر پارامتر را ارائه میدهد و حتی از برخی مدلهای تخصصی با ابعاد دو برابر بزرگتر نیز عملکرد بهتری به جا گذاشته است.
البته باید توجه داشت که امتیاز بنچمارکها به نوع مجموعه داده، پیشپردازش، ابعاد بردار و تنظیمات کوانتیزهسازی بستگی دارد؛ بنابراین برای استقرار در محیط واقعی، بررسی عملکرد روی سختافزار مقصد ضروری است. مدلهای امبدینگ غولپیکرتر هنوز هم دقت بالاتری ثبت میکنند و پیکربندی چندوجهی کامل این مدل نیز پیش از احتساب منابع خودِ اپلیکیشن، بیش از نیم گیگابایت از رم فعال دستگاه را اشغال مینماید.
یک پشته نرمافزاری یکپارچه برای بازیابی و تولید محتوا
در روش تولید مبتنی بر بازیابی یا همان RAG، سیستم ابتدا درون یک ایندکس برداری به دنبال دادههای مرتبط میگردد و سپس نتایج را به یک مدل مولد میسپارد. جالب اینجاست که EmbeddingGemma 2 از توکنایزر متنی و انکودر صوتی مشترک با Gemma 4 بهره میبرد؛ بنابراین پلتفرمهای سازگار میتوانند از این بخشها همزمان برای هر دو فرایند بازیابی و تولید محتوا استفاده کنند.
استفاده مجدد از این مؤلفههای مشترک، حجم کل رم مورد نیاز خط لوله RAG روی گوشی را به شدت کاهش میدهد؛ قابلیتی که بهویژه برای برنامههایی که در فایلهای صوتی جستوجو کرده و سپس پاسخ تولید میکنند، یک مزیت طلایی است. البته میزان این صرفهجویی به این بستگی دارد که محیط اجرای انتخابی، بخشهای مدل را به اشتراک بگذارد یا از هر کدام نسخهای مجزا لود کند.
گوگل چند نمونه برنامه کاربردی مرجع را نیز در گالری Google AI Edge منتشر کرده است: برنامه Instant Media Search که آیتمهای رسانهای را از طریق متن یا تصویر پیدا میکند، ابزار Video Moments Finder که لحظات و بخشهای خاصی از ویدیو را بر اساس متن یا صدا جستوجو مینماید، و اپلیکیشن Google AI Edge Foresight که ترکیب EmbeddingGemma 2 و Gemma 4 را برای استدلال متنی به نمایش میگذارد.
مسیرهای استقرار و استفاده در پروژهها
وزنهای مدل در حال حاضر از طریق پلتفرمهای هاگینگ فیس (Hugging Face) و کگل (Kaggle) در دسترس است. گوگل اعلام کرده که پشتیبانی از آن بهزودی به بخش Model Garden پلتفرم ابری سازمانی جمینای نیز اضافه خواهد شد.
- استنتاج عمومی (General Inference): پشتیبانی از ابزارهای محبوب Transformers، Sentence Transformers، MLX، vLLM، llama.cpp، SGLang، Ollama و LM Studio
- استقرار روی دستگاه (Edge Deployment): استفاده از MediaPipe برای تسکهای بازیابی آماده و LiteRT برای پیادهسازیهای سفارشی
- تست مستقیم در مرورگر: نسخه آزمایشی آنلاین از طریق دموی WebGPU
- تنظیم دقیق (Fine-Tuning): راهنمای رسمی منتشرشده در مستندات Unsloth
بازیابی محلی کجا ارزش واقعی خود را نشان میدهد؟
برنامههایی که با اطلاعات حساس و محرمانه، شرایط آفلاین یا حساس به تأخیر سروکار دارند، میتوانند با کمک EmbeddingGemma 2 فرایند بازیابی را در نزدیکترین نقطه ممکن به مبدأ داده انجام دهند. سناریوهای کاربردی این مدل شامل موارد زیر است:
- جستوجوی معنایی پیشرفته میان یادداشتها، عکسها، اسناد و وویسهای ذخیرهشده روی گوشی یا رایانه
- بازیابی و کاوش محلی در کدهای پروژه برای ایجنتهای کدنویسی روی لپتاپ
- جستوجوی بینحوزهای (Cross-modal)؛ مانند پیدا کردن دقیق لحظهای از ویدیو که جملهای خاص در آن بیان شده است
- دستهبندی و مسیریابی روی دستگاه با استفاده از MediaPipe Decision Task API
بازیابی ابری همچنان برای سناریوهایی که دادهها از قبل روی سرور قرار دارند و مسائلی مثل تأخیر شبکه، دسترسی آفلاین و حریم خصوصی اولویت اصلی نیستند، انتخاب مناسبی است. اما برای اپلیکیشنهای موبایل و دسکتاپ که مستقیماً روی محتوای شخصی کاربران فعالیت میکنند، مؤلفههای مشترک این مدل با Gemma 4، قابلیت تغییر ابعاد بردارها و مصرف حافظه کمتر از ۶۰۰ مگابایت، برگ برندهای تمامعیار به شمار میرود.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگها در هر محیط کدنویسی!
ابزار امنیتی محبوب VulnHunter که توسط شرکت Capital One توسعه یافته بود، با یک فورک جامعهمحور تازه از انحصار محیط Claude Code رها شد. این ابزار متنباز با رویکرد هکرهای واقعی کدهای پروژه را اسکن میکند و حالا توسعهدهندگان میتوانند ایجنتها و اسکیلهای آن را در هر محیط کدنویسی دلخواهی برای کشف و رفع تضمینی آسیبپذیریها به کار بگیرند.

متا ابزار Rebalancer را متنباز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها
متا پس از ۹ سال استفاده داخلی، کتابخانه اختصاصی Rebalancer را بهصورت متنباز در اختیار عموم توسعهدهندگان قرار داد. این ابزار قدرتمند روزانه بیش از ۴۰ میلیون مسئله پیچیده تخصیص منابع و چیدمان سختافزار را در زیرساختهای عظیم این شرکت حلوفصل میکند. انتشار این پروژه همراه با ابزار بصری Explorer، مدیریت دیتاسنترها و سرورهای توزیعشده را برای تیمهای فنی متحول خواهد کرد.

کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپیپیست!
شرکت آنتروپیک نسخه بتای عمومی Claude for Workspace را عرضه کرد تا کاربران بتوانند چتبات کلود را مستقیماً داخل گوگل داکس، شیتس و اسلایدز به کار بگیرند. با این قابلیت، بدون نیاز به کپیپیست مداوم میان تبهای مختلف مرورگر، میتوانید متنها را در لحظه اصلاح کنید، در شیتس فرمول بسازید و اسلایدهای حرفهای طراحی کنید.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.