پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

اجرای رایگان مدل صوتی ویسپر داخل مرورگر؛ تبدیل صوت به متن بدون نیاز به پایتون!

انتشار:۸ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

کتابخانه Transformers.js با ارائه نسخه بهینه‌شده مدل Whisper Tiny، فناوری تبدیل صوت به متن را مستقیماً به محیط مرورگر وب آورده است. این دستاورد جذاب به توسعه‌دهندگان اجازه می‌دهد بدون وابستگی به زیرساخت‌ها و سرور‌های سنگین پایتون، پردازش گفتار را با سرعت بالا و به‌صورت محلی در سمت کاربر اجرا کنند.

اجرای رایگان مدل صوتی ویسپر داخل مرورگر؛ تبدیل صوت به متن بدون نیاز به پایتون!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل کوچک Whisper Tiny شرکت OpenAI حالا با فرمت ONNX بهینه شده و به برنامه‌نویس‌ها اجازه میده بدون سرور‌های سنگین پایتون، سیستم تبدیل گفتار به متن رو مستقیم داخل مرورگر با جاوااسکریپت اجرا کنن.
  • این مدل جمع‌وجور حدود ۳۹ میلیون پارامتر داره و حجم فایل‌های کوانتیزه‌شده اون تنها ۷۵ تا ۸۰ مگابایته که با WebAssembly و شتاب‌دهنده گرافیکی WebGPU به سرعت تو مرورگر بالا میاد.
  • استقبال جامعه متن‌باز از این پروژه حسابی داغ بوده؛ به طوری که تو کتابخونه Transformers.js بیش از ۸۲۴ هزار بار در ماه دانلود میشه و ده‌ها پروژه تعاملی روی هاگینگ‌فیس بر پایه اون ساخته شده.

چطور Whisper Tiny راهش را به مرورگر باز کرد؟

صفحه هاگینگ‌فیس مدل Xenova/whisper-tiny.en آمار خیره‌کننده‌ای را ثبت کرده است: بیش از ۸۲۴ هزار بار دانلود ماهانه و حداقل ۷۹ فضای عمومی (Spaces) فعال که از این مدل استفاده می‌کنند. این مخزن، کوچک‌ترین نسخه انگلیسی مدل Whisper شرکت OpenAI را در قالب فایل‌های بهینه‌شده ONNX بسته‌بندی کرده تا کتابخانه Transformers.js بتواند بدون کوچک‌ترین نیازی به سرویس‌ها یا سرور‌های پایتون، سیستم تبدیل گفتار به متن را مستقیماً داخل مرورگر کاربر به اجرا درآورد.

ویسپر در لباس جاوااسکریپت

این تبدیل و پورت نرم‌افزاری، معماری اصلی و تمام پارامترهای آموزش‌دیده مدل را بدون دستکاری حفظ کرده است. مدل Whisper Tiny English همچنان یک مدل ترنسفورمر انکودر-دیکودر با حدود ۳۹ میلیون پارامتر است که منحصراً برای تشخیص گفتار انگلیسی آموزش دیده است. تفاوت اصلی در شیوه استقرار و اجرای آن است؛ جایی که فرمت خروجی بازآرایی شده تا موتور ONNX Runtime Web بتواند از طریق وب‌اسمبلی (WebAssembly) یا شتاب‌دهنده گرافیکی WebGPU (روی مرورگرهای سازگار) آن را بی‌درنگ اجرا کند.

فرمت ONNX شبکه عصبی را به شکل یک گراف محاسباتی سبک و قابل‌حمل همراه با وزن‌های مربوطه ذخیره می‌کند. یک موتور اجرای سازگار با ONNX می‌تواند این گراف را بدون نیاز به نصب PyTorch لود کند؛ قابلیتی فوق‌العاده کاربردی که مسیر اجرای لوکال مدل‌های هوش مصنوعی را در اپلیکیشن‌های تحت وب و جاوااسکریپت هموار می‌کند.

مشخصات
آنچه در دسترس توسعه‌دهندگان است
مدل پایه
OpenAI Whisper Tiny English
موتور اجرا (Runtime)
موتور ONNX Runtime Web از طریق WebAssembly (با پشتیبانی از WebGPU در مرورگرهای سازگار)
حجم دانلودی معمول
تقریباً بین ۷۵ تا ۸۰ مگابایت برای نسخه‌های کوانتیزه‌شده رایج
زبان پشتیبانی‌شده
فقط انگلیسی
مجوز (License)
آپاچی ۲.۰ (Apache 2.0)، شامل استفاده تجاری با رعایت قوانین وابستگی‌ها و داده‌ها
برنامه نمونه (دمو)
پروژه دمو whisper-web

سریع‌ترین مسیر برای پیاده‌سازی تبدیل صوت به متن

برای پیاده‌سازی این قابلیت در پروژه‌های مبتنی بر Transformers.js، تنها به نصب یک پکیج و تنظیم یک خط‌لوله (پایپ‌لاین) تشخیص خودکار گفتار نیاز دارید:

npm install @huggingface/transformers
import { pipeline } from '@huggingface/transformers';

const transcriber = await pipeline(
  'automatic-speech-recognition',
  'Xenova/whisper-tiny.en'
);

const audio =
  'https://huggingface.co/datasets/Xenova/transformers.js-docs/resolve/main/jfk.wav';

const result = await transcriber(audio);
console.log(result.text);

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

فرمانده استارشیپ بر مسند ابررایانش؛ نقشه تازه ایلان ماسک برای دیتاسنترهای غول‌پیکر ممفیس
آخرین اخبار

فرمانده استارشیپ بر مسند ابررایانش؛ نقشه تازه ایلان ماسک برای دیتاسنترهای غول‌پیکر ممفیس

ایلان ماسک با انتصاب یکی از کهنه‌کاران پروژه استارشیپ به عنوان مدیر ارشد دیتاسنترهای ممفیس، سرعت توسعه زیرساخت‌های هوش مصنوعی خود را دوچندان کرده است. این غول پردازشی علاوه بر تقویت مدل‌های xAI، با اجاره پردازنده‌های انویدیا به شرکت‌هایی چون آنتروپیک و گوگل، درآمدی میلیاردی به جیب اسپیس‌ایکس سرازیر می‌کند.

۳ دقیقه مطالعه
۰
۸ مهر
پیش‌بینی تکان‌دهنده گارتنر: ۷۰ درصد سازمان‌ها ایجنت‌های هوش مصنوعی پیمانکاران را کنار می‌گذارند!
آخرین اخبار

پیش‌بینی تکان‌دهنده گارتنر: ۷۰ درصد سازمان‌ها ایجنت‌های هوش مصنوعی پیمانکاران را کنار می‌گذارند!

مؤسسه پژوهشی گارتنر پیش‌بینی کرده که تا سال ۲۰۲۸، از هر ۱۰ شرکت، ۷ مورد پروژه‌های ایجنت هوش مصنوعی ساخته‌شده توسط پیمانکاران را به دلیل هزینه‌های سرسام‌آور و ناتوانی در نگهداری مستقل رها می‌کنند. به گفته تحلیلگران، وابستگی شدید به مهندسان خارجی و شگردهای بازاریابی فریبنده، سازمان‌ها را در دام هزینه‌های گزاف گرفتار کرده است. گارتنر به مدیران فنی توصیه می‌کند پیش از ورود به قراردادهای گران‌قیمت، روی توانمندسازی و ساخت مهارت‌های تیم داخلی خود تمرکز کنند.

۳ دقیقه مطالعه
۰
۸ مهر
صندوق ۲۰۰ میلیون دلاری دن آیوز کلید خورد: فرصت خرید سهام غول‌های خصوصی هوش مصنوعی برای مردم عادی!
آخرین اخبار

صندوق ۲۰۰ میلیون دلاری دن آیوز کلید خورد: فرصت خرید سهام غول‌های خصوصی هوش مصنوعی برای مردم عادی!

دن آیوز، تحلیلگر نام‌آشنای وال‌استریت، با راه‌اندازی یک صندوق ۲۰۰ میلیون دلاری در بورس نیویورک، راه را برای سرمایه‌گذاران عادی هموار کرده تا بتوانند پیش از عرضه عمومی، در استارتاپ‌های بزرگ و خصوصی هوش مصنوعی سهام بخرند. هدف این صندوق شکستن انحصار سرمایه‌گذاران سیلیکون‌ولی و ایجاد فرصتی برابر برای عموم مردم در انقلاب هوش مصنوعی است.

۲ دقیقه مطالعه
۰
۸ مهر