پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

جمینای لایو چشم جدید نابینایان شد؛ راهنمایی صوتی و لحظه‌ای با دوربین گوشی در اندروید

انتشار:۱۵ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

گوگل با افزودن قابلیت Guided Vision به چت صوتی جمینای لایو (Gemini Live)، تحولی کاربردی برای افراد نابینا و کم‌بینا ایجاد کرده است. این ویژگی جذاب نه‌تنها محیط اطراف را از طریق دوربین گوشی به صورت صوتی توصیف می‌کند، بلکه با راهنمایی‌های لحظه‌ای به کاربر می‌گوید چطور زاویه دوربین را برای دید بهتر تنظیم کند.

جمینای لایو چشم جدید نابینایان شد؛ راهنمایی صوتی و لحظه‌ای با دوربین گوشی در اندروید

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • گوگل قابلیت هوشمند دید هدایت‌شده (Guided Vision) را به جمینای لایو در اندروید اضافه کرد تا محیط اطراف را با دوربین گوشی برای کاربران نابینا و کم‌بینا به صورت صوتی توصیف کند.
  • تفاوت بزرگ این سیستم تعاملی بودن آن است؛ جمینای قبل از پاسخ دادن، از کاربر می‌خواهد زاویه دوربین را تنظیم کند یا عقب‌تر برود و برای آموزش آن از ده‌ها هزار ساعت داده تخصصی شرکت Aira استفاده شده است.
  • گوگل صراحتاً هشدار داده که این ابزار هرگز جایگزین عصای سفید یا راهنمای انسانی نمی‌شود و برای تردد یا تشخیص موانع نیست؛ ضمن این که هنوز هیچ API یا دسترسی نرم‌افزاری برای توسعه‌دهندگان ارائه نشده است.

جمینای لایو راهنمای صوتی و بینایی هوشمند را به اندروید آورد

گوگل قابلیت تازه‌ای به نام دید هدایت‌شده (Guided Vision) را به جمینای لایو (Gemini Live) اضافه کرده تا افراد نابینا یا کم‌بینا بتوانند با کمک دوربین گوشی، توصیف‌های صوتی دقیق و لحظه‌ای از دنیای اطرافشان دریافت کنند. نکته جذاب ماجرا اینجاست که این قابلیت در طول گفت‌وگو با کاربر پیوستگی صحبت را حفظ می‌کند و اگر برای دیدن یک سوژه به تصویر بهتری نیاز داشته باشد، خودش صراحتاً به کاربر می‌گوید که مثلاً گوشی را کمی کج کند، آرام بچرخاند یا چند قدم به عقب برود.

راهنمایی پیش از پاسخ نهایی

ویژگی Guided Vision ورودی‌های دوربین را در همان دل مکالمه زنده جمینای لایو پردازش می‌کند. کاربر می‌تواند درباره هر جسمی که پیش رویش است سوال بپرسد، زاویه دوربین را بر اساس دستورالعمل‌های جمینای تنظیم کند و بدون نیاز به ثبت عکس جدید یا باز کردن دوباره چت، بلافاصله پرسش‌های بعدی خود را مطرح کند.

اگر زاویه دوربین خیلی بالا باشد، به سوژه زیادی نزدیک شده باشد یا بخشی از جسم در کادر جا نمانده باشد، جمینای قبل از آنکه جوابی بدهد، از کاربر می‌خواهد موقعیت دوربین را اصلاح کند. این بازخورد زنده یک حلقه تعاملی میان مدل هوش مصنوعی و کاربر ایجاد می‌کند و یکی از بزرگ‌ترین چالش‌های دستیارهای دوربین‌محور را حل می‌کند: یعنی این که کاربر نابینا یا کم‌بینا ممکن است نداند آیا سوژه اصلاً داخل کادر دوربین افتاده و تصویر واضح است یا نه.

طراحی‌شده برای بررسی‌های بصری سریع و روزمره

گوگل قابلیت Guided Vision را مخصوص کار‌های روزمره‌ای معرفی کرده که فرد در حالت ثابت یا موقعیتی تحت کنترل انجام می‌دهد. مثال‌های ارائه‌شده چهار دسته کلی را در بر می‌گیرد:

نوع وظیفه
مثال‌ها
کمکی که ارائه می‌دهد
خواندن جزئیات
جدول ارزش غذایی، دکمه‌های کنترل لوازم خانگی، برنامه‌های ماشین لباسشویی و منوهای چاپی
تشخیص متن‌ها یا تنظیمات دستگاه و خواندن صوتی آن‌ها
پیدا کردن وسایل اطراف
هندزفری افتاده روی زمین یا قوطی ادویه در یک کابینت شلوغ
اسکن محیط نزدیک و هدایت دوربین به سمت وسایل مورد نظر
مقایسه ظاهر وسایل
رنگ، طرح و هماهنگی لباس‌ها با یکدیگر
توصیف ویژگی‌های ظاهری و پاسخ به پرسش‌های تکمیلی
درک فضای محیط
چیدمان اتاق یا وسایلی که روی یک میز چیده شده‌اند
ارائه یک نمای کلی توصیفی بدون ورود به حیطه مسیریابی حرکتی

مترجمان حرفه‌ای بینایی؛ معماران داده‌های آموزشی

گوگل برای توسعه این قابلیت دست به همکاری با شرکت آیرا (Aira) زده است؛ پلتفرمی حرفه‌ای که خدمات راهنمایی بصری به نابینایان ارائه می‌دهد. آیرا ده‌ها هزار ساعت داده توصیف دیداری از دنیای واقعی را جمع‌آوری و حاشیه‌نویسی کرده تا جمینای لایو بتواند برای دستیاری صوتی و کاربردی به بهترین شکل ممکن آموزش ببیند.

بیش از ۱۰۰۰ نفر از اعضای شبکه ارزیابان معتمد آیرا این سیستم را در کار‌های روزمره خود تست و ارزیابی کردند. علاوه بر این، متخصصان آیرا به عنوان کارشناسان خبره در کنار تیم گوگل حضور داشتند تا رفتار مدل را بهبود ببخشند و چارچوب‌های ایمنی آن را ارزیابی کنند.

تفسیر بصری تخصصی می‌تواند زنجیره اقداماتی را که برای انجام یک کار لازم است به خوبی ثبت کند؛ از جمله زمان دقیق درخواست کادر بازتر، چرخش آرام‌تر یا زاویه دید متفاوت. البته گوگل هنوز جزییات روش‌های تنظیم دقیق (Fine-tuning)، ترکیب دیتاست، نتایج بنچمارک‌ها یا تحلیلی از میزان اثرگذاری داده‌های آیرا روی قابلیت‌های مدل منتشر نکرده است.

سه روش برای دسترسی به دوربین

قابلیت Guided Vision کاملاً با جمینای لایو و بخش تنظیمات دسترسی‌پذیری (Accessibility) اندروید یکپارچه شده و کاربران به چند روش ساده می‌توانند آن را فعال کنند:

  1. از طریق جمینای لایو: فعال‌سازی ویژگی دید هدایت‌شده در تنظیمات پروفایل جمینای، آغاز یک نشست گفت‌وگوی زنده و به اشتراک گذاشتن دوربین.
  2. میانبر دسترسی‌پذیری (Accessibility Shortcut): تنظیم قابلیت برای اجرا از طریق دکمه شناور دسترسی‌پذیری، سوایپ با دو انگشت یا فشردن هم‌زمان هر دو کلید تنظیم صدا.
  3. قابلیت تاک‌بک (TalkBack): باز کردن منوی تاک‌بک با ضربه زدن سه‌انگشتی و انتخاب گزینه Guided Vision.

گوگل اعلام کرده که این ویژگی به اندروید ۹ یا بالا‌تر نیاز دارد. البته دسترسی به آن به پشتیبانی جمینای لایو در منطقه جغرافیایی و زبان کاربر هم وابسته است. به گفته گوگل، این ویژگی با مشارکت جوامع نابینایان و کم‌بینایان در کشور‌هایی مثل هند، برزیل، سنگاپور، اندونزی و ژاپن آزمایش شده، هرچند گزارش آماری دقیقی از کیفیت عملکرد در هر زبان ارائه نشده است.

مرزهای ایمنی و محدودیت‌های مهم این فناوری

گوگل تأکید کرده که Guided Vision یک ابزار کمکی است که ممکن است خطا داشته باشد و مرزهای مشخصی برای استفاده از آن تعیین کرده است:

  • خروجی‌های سیستم ممکن است حاوی توصیف‌های اشتباه یا جا انداختن برخی جزئیات باشد.
  • این ویژگی اصلاً برای مسیریابی، راهنمایی تردد ایمن در خیابان یا تشخیص موانع حرکتی طراحی نشده است.
  • پاسخ‌های هوش مصنوعی به‌هیچ‌وجه نمی‌تواند جایگزین عصای سفید، وسایل کمکی حرکتی، راهنمای بینایی حرفه‌ای یا تجهیزات پزشکی شود.

این محدودیت‌ها به خوبی حساسیت خطاهای احتمالی در سیستم‌های بینایی لحظه‌ای را نشان می‌دهند. اشتباه خواندن برچسب یک محصول شاید فقط روند کار را مختل کند، اما ندیدن لبه جدول خیابان، ماشین در حال حرکت یا مانعی در بالای سر می‌تواند خطرات جانی جدی به همراه داشته باشد. از همین رو، کاربردهای اعلام‌شده برای Guided Vision منحصراً روی بررسی اشیا و فضاهای اطراف از یک موقعیت ثابت متمرکز است.

چرخه هوشمند ورودی؛ الگویی کاربردی برای سایر سیستم‌ها

نحوه کار Guided Vision یک چرخه سنجش کیفیت ورودی را به نمایش می‌گذارد که می‌تواند به سایر سیستم‌های هوش مصنوعی مبتنی بر دوربین نیز راه پیدا کند:

  1. بررسی داده‌های بصری موجود در تصویر.
  2. سنجش این که آیا کادربندی برای ارائه یک پاسخ مطمئن کافی است یا نه.
  3. درخواست تغییر وضعیت یا حرکت فیزیکی دوربین در صورت نیاز به اطلاعات بیش‌تر.
  4. حفظ پیوستگی مکالمه و بافتار گفت‌وگو در زاویه دید جدید.
  5. ارائه پاسخ نهایی به محض دریافت جزئیات کافی از دوربین.

این الگو می‌تواند از بازرسی‌های از راه دور، عیب‌یابی تجهیزات فنی، هدایت از دور و هر سناریوی دیگری که در آن مدل برای تنظیم زاویه دوربین به کاربر متکی است پشتیبانی کند. ارزش اصلی این فرآیند در این است که گردآوری اطلاعات بصری را به بخشی پویا از گفت‌وگو تبدیل می‌کند، به جای این که هر فریم دریافتی را بی‌چون‌وچرا یک نمای کامل فرض کند.

گوگل در حال حاضر Guided Vision را فقط به عنوان قابلیتی در اپلیکیشن جمینای عرضه کرده است. در این اطلاعیه هیچ صحبتی از ارائه API، کیت توسعه نرم‌افزار (SDK) یا دسترسی برنامه‌نویسی به مکانیسم تنظیم کادر و داده‌های آموزشی آیرا نشده؛ بنابراین توسعه‌دهندگان نمی‌توانند فعلاً این چرخه کامل را مستقیماً به برنامه‌های خود اضافه کنند.

میدان شلوغ دستیارهای بینایی هوشمند

گوگل با این قابلیت پا به بازاری می‌گذارد که بازیگران بزرگی در آن فعال هستند؛ از جمله ابزار بی مای ای‌آی (Be My AI) که حاصل همکاری پلتفرم Be My Eyes با شرکت OpenAI است، دستیار بینایی در عینک‌های هوشمند ری‌بن متا، و قابلیت‌های متنوع اپل مثل توصیف تصاویر و حالت شناسایی (Recognition Mode). رویکرد گوگل ترکیبی از درک مکالمه‌ای جمینای لایو، میانبرهای دسترسی‌پذیری اندروید و تخصص مترجمان حرفه‌ای است.

با این همه، هنوز پرسش‌های فنی متعددی برای پژوهشگران و تیم‌های محصول بی‌پاسخ مانده است. گوگل هنوز اطلاعاتی درباره میزان دقت در هر وظیفه، نرخ تأخیر در دستگاه‌های مختلف، عملکرد در نور ضعیف، نرخ خطا در زبان‌های گوناگون یا سازوکار ذخیره‌سازی داده‌های دوربین منتشر نکرده است. همین سنجش‌های فنی در دنیای واقعی مشخص خواهند کرد که این طراحی تعاملی در خارج از محیط‌های آزمایشگاهی چقدر می‌تواند پایدار و قابل اعتماد عمل کند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

چرا غول‌های هوش مصنوعی چیزی ساختن که خودشون هم ازش وحشت دارن؟ ناگفته‌های شنیدنی کوین روز
آخرین اخبار

چرا غول‌های هوش مصنوعی چیزی ساختن که خودشون هم ازش وحشت دارن؟ ناگفته‌های شنیدنی کوین روز

چرا چهره‌هایی مثل داریو آمودی و سم آلتمن با وجود هشدارهای ترسناک درباره خطرات هوش مصنوعی، همچنان دیوانه‌وار برای توسعه آن با هم مسابقه می‌دهند؟ کوین روز، روزنامه‌نگار باسابقه فناوری، در کتاب تازه و گفت‌وگوی جذاب خود پرده از اضطراب‌های آخرالزمانی و پشت‌پرده رقابت جنون‌آمیز هوش مصنوعی در سان‌فرانسیسکو برمی‌دارد.

۹ دقیقه مطالعه
۰
۱۵ مهر
ابزار‌های جدید هوش مصنوعی متا؛ ردگیری تبلیغات فریبنده‌ای که به آزار کودکان ختم می‌شوند
آخرین اخبار

ابزار‌های جدید هوش مصنوعی متا؛ ردگیری تبلیغات فریبنده‌ای که به آزار کودکان ختم می‌شوند

متا ابزار‌های جدیدی مبتنی بر هوش مصنوعی و مدل‌های زبانی معرفی کرده تا تبلیغات به ظاهر سالمی را که کاربران را مخفیانه به سمت محتوای مجرمانه و آزار کودکان هدایت می‌کنند، ردگیری و مسدود کند. این شرکت با بررسی مقصد لینک‌ها و به‌کارگیری ایجنت‌های هوش مصنوعی، درصدد بستن راه‌های فرار متخلفان برآمده است.

۳ دقیقه مطالعه
۰
۱۵ مهر
وقتی هوش مصنوعی ردپایش را پاک می‌کند: سوءاستفاده از باگ MathJax برای جعل لاگ‌های ایمنی در Inspect
آخرین اخبار

وقتی هوش مصنوعی ردپایش را پاک می‌کند: سوءاستفاده از باگ MathJax برای جعل لاگ‌های ایمنی در Inspect

پژوهشگران سازمان METR با کشف یک آسیب‌پذیری در فریم‌ورک ایمنی Inspect نشان دادند که ایجنت‌های هوش مصنوعی می‌توانند با سوءاستفاده از کتابخانه MathJax، لاگ‌های عملکرد خود را دستکاری کنند و خطاهایشان را بپوشانند. هرچند این باگ تنها ظرف یک روز با یک پچ امنیتی برطرف شد، اما زنگ خطری جدی درباره نفوذپذیری ابزار‌های نظارت بر هوش مصنوعی به صدا درآورد.

۵ دقیقه مطالعه
۰
۱۵ مهر