تایپ بدون صدا در مک با لبخوانی هوش مصنوعی؛ معرفی برنامه متنباز Lipflow
Lipflow یک برنامه متنباز و کاربردی برای مک است که با تکیه بر وبکم و هوش مصنوعی، حرکات لب شما را در سکوت کامل لبخوانی کرده و کلمات را مستقیماً در محل نشانگر ماوس تایپ میکند. این نرمافزار تمام پردازشهای بینایی ماشین را بهشکل محلی روی تراشههای اپل سیلیکون اجرا میکند تا نیازی به اتصال اینترنت نباشد. با این ابزار میتوانید در فضاهای کاری اشتراکی، کتابخانهها یا محیطهای ساکت، بدون ایجاد کوچکترین صدایی متنهای دلخواهتان را تایپ کنید.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- برنامه متنباز Lipflow با بهرهگیری از وبکم و بینایی ماشین، کلماتی را که بدون صدا فقط با حرکت لب ادا میکنید تشخیص داده و مستقیماً در نرمافزار فعال مک تایپ میکند.
- تمام مراحل پردازش تصویر و تشخیص لبخوانی بهصورت کاملاً آفلاین روی پردازندههای اپل سیلیکون انجام میشود؛ هرچند برای ویرایش نهایی متن، امکان ارسال اختیاری به مدل هوش مصنوعی کلود (Claude) متعلق به شرکت آنتروپیک نیز فراهم است.
- استفاده از آن بسیار ساده است؛ کافی است کلید Option سمت راست را هنگام ادای کلمات نگه دارید و با رها کردنش متن را تحویل بگیرید، یا با دو بار فشردن کلید، حالت ضبط خودکار ۶۰ ثانیهای را فعال کنید.
تبدیل لبخوانی بیصدا به تایپ خودکار در مک با Lipflow
پروژه متنباز Lipflow یک نمونه اولیه و جالب برای سیستمعامل مک (macOS) است که میتواند کلماتی را که فقط با لب و بدون ذرهای صدا ادا میکنید، به متن تبدیل کند و درست در محل نشانگر ماوس تایپ نماید. این برنامه از طریق وبکم حرکات لبهای کاربر را زیر نظر میگیرد، پردازش تشخیص گفتار بصری (Visual Speech Recognition) را مستقیماً روی تراشههای اپل سیلیکون اجرا میکند و در نهایت متن حاصل را درون هر برنامهای که باز کردهاید مینشاند. این قابلیت برای فضاهای کاری اشتراکی، کتابخانهها یا هر جایی که صحبت کردن با صدای بلند ممکن نیست، یک راهکار دیکته کاملاً بیصدا و کاربردی به شمار میرود.
تمام فرایند تشخیص کلمات و شخصیسازی مدلها بهشکل محلی و آفلاین روی دستگاه انجام میشود. حتی مرحله پاکسازی و اصلاح متن هم میتواند کاملاً آفلاین بماند؛ هرچند کاربران در صورت تمایل میتوانند رونوشتهای احتمالی و تایپهای اخیر را برای بازنویسی دقیقتر به مدل هوش مصنوعی کلود (Claude) متعلق به شرکت آنتروپیک (Anthropic) بفرستند. کدهای این برنامه تحت مجوز آزاد MIT منتشر شدهاند، اما وزنهای مدلی که روی دیتاست معروف LRS3 آموزش دیده، صرفاً به کاربردهای تحقیقاتی و غیرتجاری محدود است.
کنترل برنامه بسیار ساده و سرراست طراحی شده است: کافی است کلید Option سمت راست کیبورد را نگه دارید، کلمات را با لبتان بدون صدا بگویید و سپس کلید را رها کنید تا متن بلافاصله تایپ و جایگذاری شود. علاوه بر این، با دو بار فشردن پشت سر هم (Double-tap) همین کلید، یک جلسه تایپ خودکار بدون نیاز به نگه داشتن دکمه تا سقف ۶۰ ثانیه فعال میشود. در حالت پیشفرض برنامه، اساساً هیچ نیازی به استفاده از میکروفون یا ضبط صدا وجود ندارد.
از تصویر وبکم تا متن نهایی؛ هوش مصنوعی پشت صحنه چطور کار میکند؟
در طول فرایند دریافت تصویر، فریمورک MediaPipe FaceLandmarker نقاط کلیدی صورت را فریم به فریم دنبال میکند؛ بنابراین هیچ نیازی به پردازش مجدد چهره پس از پایان ضبط نیست. در ادامه، Lipflow تصویر هر چهره را بر اساس نقاط اتکای چشمها، پایه بینی و دهان با چهره مبنای دادههای آموزشی هماهنگ و همتراز میکند. سپس یک برش ۹۶ در ۹۶ پیکسلی سیاهوسفید از ناحیه دهان جدا شده و نرخ فریم ویدیو با استاندارد ۲۵ فریم بر ثانیه که مدل به آن نیاز دارد تنظیم میشود.
مرحله | پیادهسازی | هدف و کارکرد |
|---|---|---|
بخش بصری (Visual front end) | شبکه کانولوشنی سهبعدی ResNet | استخراج ویژگیهای مکانی و حرکتی از فریمهای متوالی لب و دهان. |
انکودر توالی (Sequence encoder) | معماری کانفورمر (Conformer) | ترکیب کانولوشن محلی با مکانیزم توجه (Attention) در سراسر جمله اداشده. |
دیکودر متن (Text decoder) | ترنسفورمر با آموزش CTC | نگاشت توالی بصری به متن همراه با یادگیری همترازی دقیق میان فریمها و توکنها. |
جستجوی گزینهها (Candidate search) | مدل زبانی زیرکلمهای (Subword) و جستجوی پرتویی (Beam search) | رتبهبندی چندین نگارش محتمل برای ارسال به مرحله نهایی پالایش و ویرایش متن. |
سیستم زیربنایی این برنامه یعنی Auto-AVSR روی مجموعه داده تحقیقاتی LRS3 (که شامل ویدیوهای باکیفیت از گفتار افراد است)، نرخ خطای کلمات (Word Error Rate یا WER) معادل ۱۹.۱ درصد ثبت کرده است. معیار نرخ خطا تعداد جابهجاییها، حذفها و افزودنهای اشتباه نسبت به متن مرجع را اندازه میگیرد و طبیعی است که هرچه این عدد کمتر باشد، دقت سیستم بالاتر است. البته باید در نظر داشت که در لبخوانی بیصدا، دامنه حرکت لبها معمولاً ظریفتر و کوچکتر از گفتار صدادار موجود در ویدیوهای آزمایشی است و همین موضوع چالش کار را دوچندان میکند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

مدل قدرتمند GLM-5.3 به آمازون بدراک آمد؛ هیولای ۱ میلیون توکنی Z.ai برای کدنویسی و ایجنتها
آمازون وب سرویسز (AWS) رسماً مدل پرچمدار GLM-5.3 توسعهیافته توسط شرکت Z.ai را به پلتفرم ابری بدراک اضافه کرد. این مدل وزنباز با پشتیبانی از پنجره زمینه خارقالعاده ۱ میلیون توکنی و بهینهسازی ویژه برای وظایف مهندسی نرمافزار، انتخابی ایدهآل برای توسعه ایجنتهای خودکار و ریفکتور کدهای حجیم به شمار میرود.

میلیارد دلار، پول خرد تازه سیلیکونولی؛ پشت پرده ارزشگذاریهای نجومی استارتاپهای هوش مصنوعی
در سیلیکونولی ارزشگذاریهای میلیاردی برای استارتاپهای هوش مصنوعی به یک اتفاق عادی و روزمره تبدیل شده است؛ گویی یک میلیارد دلار حکم پول خرد جدید را دارد. اما آیا این ارقام نجومی که خیلی وقتها پیش از عرضه اولین محصول ثبت میشوند، پشتوانه واقعی دارند یا صرفاً قماری بزرگ روی آینده هستند؟

چتهای ChatGPT شما باارزشتر از چیزیه که فکر میکنید؛ راهنمای کامل بکاپگیری از گفتگوها
فرقی نمیکنه کاربر روزمره ChatGPT باشید یا گهگاه سراغش برید؛ تاریخچه چتهای شما پر از ایدهها و اسناد باارزشه که نباید فقط به سرورهای اوپنایآی متکی باشن. توی این راهنمای کاربردی یاد میگیرید که چطور به سادگی از تمام گفتگوهای خود فایل پشتیبان بگیرید و اون رو در جایی امن ذخیره کنید.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.