غولکشی با ۱۶۴ مگابایت؛ مدل متنباز Phonon-2 با خطای ۵ درصدی ویسپر را پشت سر گذاشت!
استارتاپ تحقیقاتی فرمیون (Fermion Research) با عرضه مدل متنباز Phonon-2 سر و صدای زیادی به پا کرده است؛ مدلی که با حجم فوقالعاده اندک ۱۶۴ مگابایتیاش، دقتی خیرهکننده در تشخیص گفتار انگلیسی ارائه میدهد. این هوش مصنوعی جمعوجور نهتنها از مدلهای بسیار سنگینتر بازار عملکرد بهتری ثبت کرده، بلکه اجرای محلی و بدون نیاز به اینترنت تبدیل گفتار به متن را روی دستگاههای معمولی هم ممکن میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل متنباز Phonon-2 با حجم باورنکردنی ۱۶۴ مگابایت منتشر شد؛ این مدل در ارزیابی دیتاستهای لیدربورد Open ASR به نرخ خطای فوقالعاده پایین ۵.۲۱ درصد رسیده که در میان تمام مدلهای زیر ۹۰۰ مگابایت یک رکورد به حساب میآید.
- این مدل با تکنیک تقطیر دانش (Distillation) از مدل غولپیکر Parakeet TDT انویدیا مشتق شده؛ یعنی با وجود کاهش حجم به یکپانزدهم مدل ۲.۵ گیگابایتی معلم، تقریباً پا به پای آن حرکت میکند و همان دقت را تحویل میدهد.
- فرمیون با فشردهسازی شگفتانگیز و رساندن هر وزن به حدود ۲.۱ بیت، کاری کرده که اجرای محلی و سریع تبدیل صوت به متن روی دستگاههای لبه (Edge) و سیستمهای معمولی بدون نیاز به سرورهای ابری ممکن شود.
مدل Phonon-2؛ تبدیل دقیق صوت به متن تنها با دانلود ۱۶۴ مگابایت
آزمایشگاه پژوهشی فرمیون (Fermion Research) وزنهای مدل Phonon-2 را منتشر کرد؛ یک مدل متنباز تشخیص گفتار انگلیسی که کل حجم دانلود آن فقط ۱۶۴ مگابایت است. این مدل در هفت مجموعهداده انگلیسی لیدربورد معروف Open ASR به میانگین نرخ خطای کلمات (WER) خیرهکننده ۵.۲۱ درصد دست پیدا کرده است. در مقایسهای که فرمیون منتشر کرده، این کمترین میزان خطای ثبتشده در میان تمام مدلهای متنباز با حجم کمتر از ۹۰۰ مگابایت به حساب میآید. جالب است بدانید که نرخ خطای کلمات پایینتر به این معناست که مدل در پیادهسازی متن، کلمات اشتباه، حذفی یا اضافی بسیار کمتری تولید میکند و خروجی تمیزتری تحویل میدهد.
مدل Phonon-2 با استفاده از روش تقطیر دانش (Distillation) از مدل Parakeet TDT 0.6B v3 شرکت انویدیا (NVIDIA) مشتق شده و تمام ویژگیهای کلیدی آن از جمله توکنایزر، علامتگذاری، حروف بزرگ و کوچک و قواعد نگارش اعداد را دقیقاً حفظ کرده است. نکته شگفتانگیز اینجاست که حجم این مدل فشرده تقریباً یکپانزدهم مدل معلم ۲۵۰۸ مگابایتی آن است؛ اتفاقی که اجرای محلی تبدیل صوت به متن، پیادهسازی روی دستگاههای لبه (Edge) و پردازش دستهای انبوه فایلهای صوتی را بدون نیاز به زیرساختهای سنگین به یک گزینه کاملاً کاربردی تبدیل میکند.
پنج سطح مقداری برای هر وزن؛ راز فشردهسازی خارقالعاده مدل
بخش انکودر مدل Phonon-2 هر وزن را در قالب یکی از پنج مقدار یادگرفتهشده ذخیره میکند که میانگین حجم آن را به حدود ۲.۱ بیت به ازای هر وزن میرساند! علاوه بر این، جدولهای جستوجوی ۶ بیتی (Lookup Tables) به سرعت اجرای استنتاج (اینفرنس) مدل کمک میکنند. فرمیون در فرآیند بهینهسازی از تکنیک «تقطیر آگاه از کوانتیزاسیون» بهره برده است؛ روشی که این محدودیتهای بیتی پایین را مستقیماً وارد چرخه آموزش میکند تا مدل دانشآموز بتواند بدون افت کیفیت، خود را با این نمایش فشرده هماهنگ سازد.
در ارزیابی کامل این هفت بنچمارک معتبر، میانگین خطای Phonon-2 نسبت به مدل معلم غولپیکرش (که از دقت کامل اعشاری بهره میبرد) تنها ۰.۲۵ درصد تفاوت دارد. نکته جالبتر اینکه نتایج تفکیکی فرمیون نشان میدهد دقت کلمات این مدل در پیادهسازی سخنرانیهای پارلمانی به ۱۰۰.۸ درصد دقت مدل معلم رسیده (یعنی حتی از خود معلم هم دقیقتر عمل کرده!) و در فایلهای صوتی جلسات نیز نرخ خطای به مراتب کمتری را به ثبت رسانده است.
مدل | حجم دانلود | میانگین نرخ خطا (WER) |
|---|
مطالب مرتبط و پیشنهادی

جنجال بزرگ در مسابقه میکروسکوپی نیکون؛ آیا ویدیوی برنده کار هوش مصنوعی بود؟
پس از جنجالهای فراوان درباره ویدیوی برنده مسابقه فیلمبرداری میکروسکوپی Small World، شرکت نیکون اعلام کرد در حال بررسی دقیق ادعاهای مربوط به استفاده از هوش مصنوعی در این اثر است. محققان متوجه رفتارهای غیرعادی در حرکت سلولها و حتی ردپای واترمارک ابزارهای هوش مصنوعی در این ویدیو شدهاند.

مجلس ختم برای اپلیکیشنهای موبایل؛ استارتاپ Photon با ۴.۵ میلیون دلار سرمایه، ایجنتهای هوش مصنوعی را جایگزین اپها میکند
استارتاپ فوتون (Photon) باور دارد که کاربران دیگر تمایلی به نصب برنامههای جدید ندارند و آینده متعلق به ایجنتهای هوش مصنوعی در پیامرسانهاست؛ باوری که حتی باعث شد برای اپهای موبایل در یک کلیسا مجلس ختم نمادین برگزار کند! حالا این تیم با جذب ۴.۵ میلیون دلار سرمایه قصد دارد پلتفرمی توسعه دهد که ساخت و اجرای ایجنتها را در بستر iMessage، تلگرام و واتساپ آسان میکند.

وقتی ایجنت هوش مصنوعی ناظر امنیت شرکت میشود، چه کسی خود ایجنت را چک میکند؟
امروزه شرکتها برای خلاص شدن از کاغذبازیهای طولانی و طاقتفرسای ممیزی، دستبهدامن ایجنتهای هوش مصنوعی شدهاند؛ اما سپردن نظارتهای امنیتی به این دستیاران هوشمند، چالشهای جدیدی ساخته است. وقتی یک ایجنت هوش مصنوعی وظیفه تأیید امنیت سازمان را به عهده میگیرد، چه کسی صلاحیت و رفتار خود او را بازرسی خواهد کرد؟ بدون داشتن نظارت مستمر و تعیین دقیق مرز دسترسیها، به جای امنیت واقعی فقط یک «نمایش امنیتی» پرهزینه نصیب شرکتها خواهد شد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.