جمینای لایو چشم جدید نابینایان شد؛ راهنمایی صوتی و لحظهای با دوربین گوشی در اندروید
گوگل با افزودن قابلیت Guided Vision به چت صوتی جمینای لایو (Gemini Live)، تحولی کاربردی برای افراد نابینا و کمبینا ایجاد کرده است. این ویژگی جذاب نهتنها محیط اطراف را از طریق دوربین گوشی به صورت صوتی توصیف میکند، بلکه با راهنماییهای لحظهای به کاربر میگوید چطور زاویه دوربین را برای دید بهتر تنظیم کند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- گوگل قابلیت هوشمند دید هدایتشده (Guided Vision) را به جمینای لایو در اندروید اضافه کرد تا محیط اطراف را با دوربین گوشی برای کاربران نابینا و کمبینا به صورت صوتی توصیف کند.
- تفاوت بزرگ این سیستم تعاملی بودن آن است؛ جمینای قبل از پاسخ دادن، از کاربر میخواهد زاویه دوربین را تنظیم کند یا عقبتر برود و برای آموزش آن از دهها هزار ساعت داده تخصصی شرکت Aira استفاده شده است.
- گوگل صراحتاً هشدار داده که این ابزار هرگز جایگزین عصای سفید یا راهنمای انسانی نمیشود و برای تردد یا تشخیص موانع نیست؛ ضمن این که هنوز هیچ API یا دسترسی نرمافزاری برای توسعهدهندگان ارائه نشده است.
جمینای لایو راهنمای صوتی و بینایی هوشمند را به اندروید آورد
گوگل قابلیت تازهای به نام دید هدایتشده (Guided Vision) را به جمینای لایو (Gemini Live) اضافه کرده تا افراد نابینا یا کمبینا بتوانند با کمک دوربین گوشی، توصیفهای صوتی دقیق و لحظهای از دنیای اطرافشان دریافت کنند. نکته جذاب ماجرا اینجاست که این قابلیت در طول گفتوگو با کاربر پیوستگی صحبت را حفظ میکند و اگر برای دیدن یک سوژه به تصویر بهتری نیاز داشته باشد، خودش صراحتاً به کاربر میگوید که مثلاً گوشی را کمی کج کند، آرام بچرخاند یا چند قدم به عقب برود.
راهنمایی پیش از پاسخ نهایی
ویژگی Guided Vision ورودیهای دوربین را در همان دل مکالمه زنده جمینای لایو پردازش میکند. کاربر میتواند درباره هر جسمی که پیش رویش است سوال بپرسد، زاویه دوربین را بر اساس دستورالعملهای جمینای تنظیم کند و بدون نیاز به ثبت عکس جدید یا باز کردن دوباره چت، بلافاصله پرسشهای بعدی خود را مطرح کند.
اگر زاویه دوربین خیلی بالا باشد، به سوژه زیادی نزدیک شده باشد یا بخشی از جسم در کادر جا نمانده باشد، جمینای قبل از آنکه جوابی بدهد، از کاربر میخواهد موقعیت دوربین را اصلاح کند. این بازخورد زنده یک حلقه تعاملی میان مدل هوش مصنوعی و کاربر ایجاد میکند و یکی از بزرگترین چالشهای دستیارهای دوربینمحور را حل میکند: یعنی این که کاربر نابینا یا کمبینا ممکن است نداند آیا سوژه اصلاً داخل کادر دوربین افتاده و تصویر واضح است یا نه.
طراحیشده برای بررسیهای بصری سریع و روزمره
گوگل قابلیت Guided Vision را مخصوص کارهای روزمرهای معرفی کرده که فرد در حالت ثابت یا موقعیتی تحت کنترل انجام میدهد. مثالهای ارائهشده چهار دسته کلی را در بر میگیرد:
نوع وظیفه | مثالها | کمکی که ارائه میدهد |
|---|---|---|
خواندن جزئیات | جدول ارزش غذایی، دکمههای کنترل لوازم خانگی، برنامههای ماشین لباسشویی و منوهای چاپی | تشخیص متنها یا تنظیمات دستگاه و خواندن صوتی آنها |
پیدا کردن وسایل اطراف | هندزفری افتاده روی زمین یا قوطی ادویه در یک کابینت شلوغ | اسکن محیط نزدیک و هدایت دوربین به سمت وسایل مورد نظر |
مقایسه ظاهر وسایل | رنگ، طرح و هماهنگی لباسها با یکدیگر | توصیف ویژگیهای ظاهری و پاسخ به پرسشهای تکمیلی |
درک فضای محیط | چیدمان اتاق یا وسایلی که روی یک میز چیده شدهاند | ارائه یک نمای کلی توصیفی بدون ورود به حیطه مسیریابی حرکتی |
مترجمان حرفهای بینایی؛ معماران دادههای آموزشی
گوگل برای توسعه این قابلیت دست به همکاری با شرکت آیرا (Aira) زده است؛ پلتفرمی حرفهای که خدمات راهنمایی بصری به نابینایان ارائه میدهد. آیرا دهها هزار ساعت داده توصیف دیداری از دنیای واقعی را جمعآوری و حاشیهنویسی کرده تا جمینای لایو بتواند برای دستیاری صوتی و کاربردی به بهترین شکل ممکن آموزش ببیند.
بیش از ۱۰۰۰ نفر از اعضای شبکه ارزیابان معتمد آیرا این سیستم را در کارهای روزمره خود تست و ارزیابی کردند. علاوه بر این، متخصصان آیرا به عنوان کارشناسان خبره در کنار تیم گوگل حضور داشتند تا رفتار مدل را بهبود ببخشند و چارچوبهای ایمنی آن را ارزیابی کنند.
تفسیر بصری تخصصی میتواند زنجیره اقداماتی را که برای انجام یک کار لازم است به خوبی ثبت کند؛ از جمله زمان دقیق درخواست کادر بازتر، چرخش آرامتر یا زاویه دید متفاوت. البته گوگل هنوز جزییات روشهای تنظیم دقیق (Fine-tuning)، ترکیب دیتاست، نتایج بنچمارکها یا تحلیلی از میزان اثرگذاری دادههای آیرا روی قابلیتهای مدل منتشر نکرده است.
سه روش برای دسترسی به دوربین
قابلیت Guided Vision کاملاً با جمینای لایو و بخش تنظیمات دسترسیپذیری (Accessibility) اندروید یکپارچه شده و کاربران به چند روش ساده میتوانند آن را فعال کنند:
- از طریق جمینای لایو: فعالسازی ویژگی دید هدایتشده در تنظیمات پروفایل جمینای، آغاز یک نشست گفتوگوی زنده و به اشتراک گذاشتن دوربین.
- میانبر دسترسیپذیری (Accessibility Shortcut): تنظیم قابلیت برای اجرا از طریق دکمه شناور دسترسیپذیری، سوایپ با دو انگشت یا فشردن همزمان هر دو کلید تنظیم صدا.
- قابلیت تاکبک (TalkBack): باز کردن منوی تاکبک با ضربه زدن سهانگشتی و انتخاب گزینه Guided Vision.
گوگل اعلام کرده که این ویژگی به اندروید ۹ یا بالاتر نیاز دارد. البته دسترسی به آن به پشتیبانی جمینای لایو در منطقه جغرافیایی و زبان کاربر هم وابسته است. به گفته گوگل، این ویژگی با مشارکت جوامع نابینایان و کمبینایان در کشورهایی مثل هند، برزیل، سنگاپور، اندونزی و ژاپن آزمایش شده، هرچند گزارش آماری دقیقی از کیفیت عملکرد در هر زبان ارائه نشده است.
مرزهای ایمنی و محدودیتهای مهم این فناوری
گوگل تأکید کرده که Guided Vision یک ابزار کمکی است که ممکن است خطا داشته باشد و مرزهای مشخصی برای استفاده از آن تعیین کرده است:
- خروجیهای سیستم ممکن است حاوی توصیفهای اشتباه یا جا انداختن برخی جزئیات باشد.
- این ویژگی اصلاً برای مسیریابی، راهنمایی تردد ایمن در خیابان یا تشخیص موانع حرکتی طراحی نشده است.
- پاسخهای هوش مصنوعی بههیچوجه نمیتواند جایگزین عصای سفید، وسایل کمکی حرکتی، راهنمای بینایی حرفهای یا تجهیزات پزشکی شود.
این محدودیتها به خوبی حساسیت خطاهای احتمالی در سیستمهای بینایی لحظهای را نشان میدهند. اشتباه خواندن برچسب یک محصول شاید فقط روند کار را مختل کند، اما ندیدن لبه جدول خیابان، ماشین در حال حرکت یا مانعی در بالای سر میتواند خطرات جانی جدی به همراه داشته باشد. از همین رو، کاربردهای اعلامشده برای Guided Vision منحصراً روی بررسی اشیا و فضاهای اطراف از یک موقعیت ثابت متمرکز است.
چرخه هوشمند ورودی؛ الگویی کاربردی برای سایر سیستمها
نحوه کار Guided Vision یک چرخه سنجش کیفیت ورودی را به نمایش میگذارد که میتواند به سایر سیستمهای هوش مصنوعی مبتنی بر دوربین نیز راه پیدا کند:
- بررسی دادههای بصری موجود در تصویر.
- سنجش این که آیا کادربندی برای ارائه یک پاسخ مطمئن کافی است یا نه.
- درخواست تغییر وضعیت یا حرکت فیزیکی دوربین در صورت نیاز به اطلاعات بیشتر.
- حفظ پیوستگی مکالمه و بافتار گفتوگو در زاویه دید جدید.
- ارائه پاسخ نهایی به محض دریافت جزئیات کافی از دوربین.
این الگو میتواند از بازرسیهای از راه دور، عیبیابی تجهیزات فنی، هدایت از دور و هر سناریوی دیگری که در آن مدل برای تنظیم زاویه دوربین به کاربر متکی است پشتیبانی کند. ارزش اصلی این فرآیند در این است که گردآوری اطلاعات بصری را به بخشی پویا از گفتوگو تبدیل میکند، به جای این که هر فریم دریافتی را بیچونوچرا یک نمای کامل فرض کند.
گوگل در حال حاضر Guided Vision را فقط به عنوان قابلیتی در اپلیکیشن جمینای عرضه کرده است. در این اطلاعیه هیچ صحبتی از ارائه API، کیت توسعه نرمافزار (SDK) یا دسترسی برنامهنویسی به مکانیسم تنظیم کادر و دادههای آموزشی آیرا نشده؛ بنابراین توسعهدهندگان نمیتوانند فعلاً این چرخه کامل را مستقیماً به برنامههای خود اضافه کنند.
میدان شلوغ دستیارهای بینایی هوشمند
گوگل با این قابلیت پا به بازاری میگذارد که بازیگران بزرگی در آن فعال هستند؛ از جمله ابزار بی مای ایآی (Be My AI) که حاصل همکاری پلتفرم Be My Eyes با شرکت OpenAI است، دستیار بینایی در عینکهای هوشمند ریبن متا، و قابلیتهای متنوع اپل مثل توصیف تصاویر و حالت شناسایی (Recognition Mode). رویکرد گوگل ترکیبی از درک مکالمهای جمینای لایو، میانبرهای دسترسیپذیری اندروید و تخصص مترجمان حرفهای است.
با این همه، هنوز پرسشهای فنی متعددی برای پژوهشگران و تیمهای محصول بیپاسخ مانده است. گوگل هنوز اطلاعاتی درباره میزان دقت در هر وظیفه، نرخ تأخیر در دستگاههای مختلف، عملکرد در نور ضعیف، نرخ خطا در زبانهای گوناگون یا سازوکار ذخیرهسازی دادههای دوربین منتشر نکرده است. همین سنجشهای فنی در دنیای واقعی مشخص خواهند کرد که این طراحی تعاملی در خارج از محیطهای آزمایشگاهی چقدر میتواند پایدار و قابل اعتماد عمل کند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

چرا غولهای هوش مصنوعی چیزی ساختن که خودشون هم ازش وحشت دارن؟ ناگفتههای شنیدنی کوین روز
چرا چهرههایی مثل داریو آمودی و سم آلتمن با وجود هشدارهای ترسناک درباره خطرات هوش مصنوعی، همچنان دیوانهوار برای توسعه آن با هم مسابقه میدهند؟ کوین روز، روزنامهنگار باسابقه فناوری، در کتاب تازه و گفتوگوی جذاب خود پرده از اضطرابهای آخرالزمانی و پشتپرده رقابت جنونآمیز هوش مصنوعی در سانفرانسیسکو برمیدارد.

ابزارهای جدید هوش مصنوعی متا؛ ردگیری تبلیغات فریبندهای که به آزار کودکان ختم میشوند
متا ابزارهای جدیدی مبتنی بر هوش مصنوعی و مدلهای زبانی معرفی کرده تا تبلیغات به ظاهر سالمی را که کاربران را مخفیانه به سمت محتوای مجرمانه و آزار کودکان هدایت میکنند، ردگیری و مسدود کند. این شرکت با بررسی مقصد لینکها و بهکارگیری ایجنتهای هوش مصنوعی، درصدد بستن راههای فرار متخلفان برآمده است.

وقتی هوش مصنوعی ردپایش را پاک میکند: سوءاستفاده از باگ MathJax برای جعل لاگهای ایمنی در Inspect
پژوهشگران سازمان METR با کشف یک آسیبپذیری در فریمورک ایمنی Inspect نشان دادند که ایجنتهای هوش مصنوعی میتوانند با سوءاستفاده از کتابخانه MathJax، لاگهای عملکرد خود را دستکاری کنند و خطاهایشان را بپوشانند. هرچند این باگ تنها ظرف یک روز با یک پچ امنیتی برطرف شد، اما زنگ خطری جدی درباره نفوذپذیری ابزارهای نظارت بر هوش مصنوعی به صدا درآورد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.