پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

غول‌کشی با ۱۶۴ مگابایت؛ مدل متن‌باز Phonon-2 با خطای ۵ درصدی ویسپر را پشت سر گذاشت!

انتشار:۹ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ تحقیقاتی فرمیون (Fermion Research) با عرضه مدل متن‌باز Phonon-2 سر و صدای زیادی به پا کرده است؛ مدلی که با حجم فوق‌العاده اندک ۱۶۴ مگابایتی‌اش، دقتی خیره‌کننده در تشخیص گفتار انگلیسی ارائه می‌دهد. این هوش مصنوعی جمع‌وجور نه‌تنها از مدل‌های بسیار سنگین‌تر بازار عملکرد بهتری ثبت کرده، بلکه اجرای محلی و بدون نیاز به اینترنت تبدیل گفتار به متن را روی دستگاه‌های معمولی هم ممکن می‌کند.

غول‌کشی با ۱۶۴ مگابایت؛ مدل متن‌باز Phonon-2 با خطای ۵ درصدی ویسپر را پشت سر گذاشت!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل متن‌باز Phonon-2 با حجم باورنکردنی ۱۶۴ مگابایت منتشر شد؛ این مدل در ارزیابی دیتاست‌های لیدربورد Open ASR به نرخ خطای فوق‌العاده پایین ۵.۲۱ درصد رسیده که در میان تمام مدل‌های زیر ۹۰۰ مگابایت یک رکورد به حساب می‌آید.
  • این مدل با تکنیک تقطیر دانش (Distillation) از مدل غول‌پیکر Parakeet TDT انویدیا مشتق شده؛ یعنی با وجود کاهش حجم به یک‌پانزدهم مدل ۲.۵ گیگابایتی معلم، تقریباً پا به پای آن حرکت می‌کند و همان دقت را تحویل می‌دهد.
  • فرمیون با فشرده‌سازی شگفت‌انگیز و رساندن هر وزن به حدود ۲.۱ بیت، کاری کرده که اجرای محلی و سریع تبدیل صوت به متن روی دستگاه‌های لبه (Edge) و سیستم‌های معمولی بدون نیاز به سرور‌های ابری ممکن شود.

مدل Phonon-2؛ تبدیل دقیق صوت به متن تنها با دانلود ۱۶۴ مگابایت

آزمایشگاه پژوهشی فرمیون (Fermion Research) وزن‌های مدل Phonon-2 را منتشر کرد؛ یک مدل متن‌باز تشخیص گفتار انگلیسی که کل حجم دانلود آن فقط ۱۶۴ مگابایت است. این مدل در هفت مجموعه‌داده انگلیسی لیدربورد معروف Open ASR به میانگین نرخ خطای کلمات (WER) خیره‌کننده ۵.۲۱ درصد دست پیدا کرده است. در مقایسه‌ای که فرمیون منتشر کرده، این کم‌ترین میزان خطای ثبت‌شده در میان تمام مدل‌های متن‌باز با حجم کم‌تر از ۹۰۰ مگابایت به حساب می‌آید. جالب است بدانید که نرخ خطای کلمات پایین‌تر به این معناست که مدل در پیاده‌سازی متن، کلمات اشتباه، حذفی یا اضافی بسیار کمتری تولید می‌کند و خروجی تمیزتری تحویل می‌دهد.

مدل Phonon-2 با استفاده از روش تقطیر دانش (Distillation) از مدل Parakeet TDT 0.6B v3 شرکت انویدیا (NVIDIA) مشتق شده و تمام ویژگی‌های کلیدی آن از جمله توکنایزر، علامت‌گذاری، حروف بزرگ و کوچک و قواعد نگارش اعداد را دقیقاً حفظ کرده است. نکته شگفت‌انگیز اینجاست که حجم این مدل فشرده تقریباً یک‌پانزدهم مدل معلم ۲۵۰۸ مگابایتی آن است؛ اتفاقی که اجرای محلی تبدیل صوت به متن، پیاده‌سازی روی دستگاه‌های لبه (Edge) و پردازش دسته‌ای انبوه فایل‌های صوتی را بدون نیاز به زیرساخت‌های سنگین به یک گزینه کاملاً کاربردی تبدیل می‌کند.

پنج سطح مقداری برای هر وزن؛ راز فشرده‌سازی خارق‌العاده مدل

بخش انکودر مدل Phonon-2 هر وزن را در قالب یکی از پنج مقدار یادگرفته‌شده ذخیره می‌کند که میانگین حجم آن را به حدود ۲.۱ بیت به ازای هر وزن می‌رساند! علاوه بر این، جدول‌های جست‌وجوی ۶ بیتی (Lookup Tables) به سرعت اجرای استنتاج (اینفرنس) مدل کمک می‌کنند. فرمیون در فرآیند بهینه‌سازی از تکنیک «تقطیر آگاه از کوانتیزاسیون» بهره برده است؛ روشی که این محدودیت‌های بیتی پایین را مستقیماً وارد چرخه آموزش می‌کند تا مدل دانش‌آموز بتواند بدون افت کیفیت، خود را با این نمایش فشرده هماهنگ سازد.

در ارزیابی کامل این هفت بنچمارک معتبر، میانگین خطای Phonon-2 نسبت به مدل معلم غول‌پیکرش (که از دقت کامل اعشاری بهره می‌برد) تنها ۰.۲۵ درصد تفاوت دارد. نکته جالب‌تر اینکه نتایج تفکیکی فرمیون نشان می‌دهد دقت کلمات این مدل در پیاده‌سازی سخنرانی‌های پارلمانی به ۱۰۰.۸ درصد دقت مدل معلم رسیده (یعنی حتی از خود معلم هم دقیق‌تر عمل کرده!) و در فایل‌های صوتی جلسات نیز نرخ خطای به مراتب کمتری را به ثبت رسانده است.

مدل
حجم دانلود
میانگین نرخ خطا (WER)

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

جنجال بزرگ در مسابقه میکروسکوپی نیکون؛ آیا ویدیوی برنده کار هوش مصنوعی بود؟
آخرین اخبار

جنجال بزرگ در مسابقه میکروسکوپی نیکون؛ آیا ویدیوی برنده کار هوش مصنوعی بود؟

پس از جنجال‌های فراوان درباره ویدیوی برنده مسابقه فیلم‌برداری میکروسکوپی Small World، شرکت نیکون اعلام کرد در حال بررسی دقیق ادعاهای مربوط به استفاده از هوش مصنوعی در این اثر است. محققان متوجه رفتارهای غیرعادی در حرکت سلول‌ها و حتی ردپای واترمارک ابزار‌های هوش مصنوعی در این ویدیو شده‌اند.

۳ دقیقه مطالعه
۰
۹ مهر
مجلس ختم برای اپلیکیشن‌های موبایل؛ استارتاپ Photon با ۴.۵ میلیون دلار سرمایه، ایجنت‌های هوش مصنوعی را جایگزین اپ‌ها می‌کند
آخرین اخبار

مجلس ختم برای اپلیکیشن‌های موبایل؛ استارتاپ Photon با ۴.۵ میلیون دلار سرمایه، ایجنت‌های هوش مصنوعی را جایگزین اپ‌ها می‌کند

استارتاپ فوتون (Photon) باور دارد که کاربران دیگر تمایلی به نصب برنامه‌های جدید ندارند و آینده متعلق به ایجنت‌های هوش مصنوعی در پیام‌رسان‌هاست؛ باوری که حتی باعث شد برای اپ‌های موبایل در یک کلیسا مجلس ختم نمادین برگزار کند! حالا این تیم با جذب ۴.۵ میلیون دلار سرمایه قصد دارد پلتفرمی توسعه دهد که ساخت و اجرای ایجنت‌ها را در بستر iMessage، تلگرام و واتساپ آسان می‌کند.

۵ دقیقه مطالعه
۰
۹ مهر
وقتی ایجنت هوش مصنوعی ناظر امنیت شرکت می‌شود، چه کسی خود ایجنت را چک می‌کند؟
آخرین اخبار

وقتی ایجنت هوش مصنوعی ناظر امنیت شرکت می‌شود، چه کسی خود ایجنت را چک می‌کند؟

امروزه شرکت‌ها برای خلاص شدن از کاغذبازی‌های طولانی و طاقت‌فرسای ممیزی، دست‌به‌دامن ایجنت‌های هوش مصنوعی شده‌اند؛ اما سپردن نظارت‌های امنیتی به این دستیاران هوشمند، چالش‌های جدیدی ساخته است. وقتی یک ایجنت هوش مصنوعی وظیفه تأیید امنیت سازمان را به عهده می‌گیرد، چه کسی صلاحیت و رفتار خود او را بازرسی خواهد کرد؟ بدون داشتن نظارت مستمر و تعیین دقیق مرز دسترسی‌ها، به جای امنیت واقعی فقط یک «نمایش امنیتی» پرهزینه نصیب شرکت‌ها خواهد شد.

۵ دقیقه مطالعه
۰
۹ مهر