رونمایی Moondream از مدل Parakeet Redux؛ تبدیل گفتار به متن محلی با حجم ۱۷۸ مگابایت
استارتاپ Moondream با فشردهسازی و کوانتایزیشن سهتایی مدل صوتی NVIDIA، نسخه جدیدی موسوم به Parakeet Redux را با حجم ۱۷۸ مگابایت عرضه کرد که اجرای محلی و سریع تبدیل گفتار به متن را روی پردازندههای معمولی ممکن میسازد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ Moondream مدل تبدیل گفتار به متن Parakeet Redux را با حجم ۱۷۸ مگابایت بر پایه مدل ۱.۲ گیگابایتی NVIDIA عرضه کرد.
- استفاده از وزنهای سهتایی (۱-، ۰ و ۱+) موجب کاهش چشمگیر پهنای باند مصرفی حافظه و اجرای روان روی CPU و Apple Silicon شده است.
- موتور استنتاج Photon با شتابدهندههای سختافزاری مختلف هماهنگ بوده و در گفتار بدون نویز عملکرد مناسبی ثبت میکند.
کاهش حجم مدل تشخیص گفتار به ۱۷۸ مگابایت با Parakeet Redux
استارتاپ Moondream از مدل تبدیل گفتار به متن جدید Parakeet Redux رونمایی کرد؛ مدلی با حجم تنها ۱۷۸ مگابایت که بر پایه مدل ۱.۲ گیگابایتی parakeet-tdt-0.6b-v3 توسعهیافته توسط NVIDIA طراحی شده است. این نسخه با حفظ معماری پایه، توکنایزر و پشتیبانی از ۲۵ زبان مختلف، تمامی وزنهای انکودر را به سه مقدار -1، 0 و +1 محدود میکند. این فشردهسازی چشمگیر، پیادهسازی و رونویسی سریع صوتی را بهشکل کاملاً محلی روی پردازندههای مرکزی (CPU) و تراشههای Apple Silicon ممکن میسازد؛ در حالی که در محیطهای صوتی بدون نویز تغییر دقت اندکی دارد و افت عملکرد بیشتر آن به شرایط پرسروصدا مربوط میشود.
حجم مدل | ۱۷۸ مگابایت (کاهش از ۱.۲ گیگابایت) |
|---|---|
وزنهای انکودر | سه مقدار: -1، 0 و +1 |
معماری | مشابه parakeet-tdt-0.6b-v3 |
زبانها | انگلیسی و ۲۴ زبان اروپایی دیگر |
مجوز | CC BY 4.0 |
کاهش بار ترافیک حافظه با وزنهای سهتایی
استنتاج محلی روی CPUها و تراشههای Apple Silicon معمولاً بهشدت به پهنای باند حافظه وابسته است؛ زیرا پردازنده ناچار است مکرراً وزنهای مدل را از حافظه فراخوانی کند. فشردهسازی هر وزن انکودر در یکی از سه حالت مجزا، این ترافیک داده را در مقایسه با فرمتهای رایج ۸ بیتی یا ۱۶ بیتی بهطور چشمگیری کاهش میدهد. برچسب «۱.۵۸ بیتی» از رابطه ریاضی log2(3) میآید که نمایانگر میزان اطلاعات لازم برای ثبت سه حالت پیش از اعمال سربار ذخیرهسازی است.
موتور استنتاج Photon متعلق به شرکت Moondream با استفاده از کرنلهای اختصاصی و بهینهسازیشده برای هر معماری سختافزاری، مستقیماً روی وزنهای فشردهشده پردازش را انجام میدهد. این موتور از قابلیتهای AVX-512 VNNI روی پردازندههای سازگار x86، دستورالعملهای NEON در پردازندههای مبتنی بر ARM و فریمورک Metal در پردازندههای گرافیکی Apple بهره میبرد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.