پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

تبدیل صوت به متن با سرعت جت؛ نسخه بهینه‌شده ویسپر مدیوم ۲.۴ برابر سریع‌تر شد!

انتشار:۷ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

تیم سیسترن با تبدیل مدل ویسپر مدیوم اوپن‌ای‌آی به موتور بهینه‌شده CTranslate2، ابزاری فوق‌العاده سریع و سبک برای تبدیل صوت به متن عرضه کرد. این نسخه با پوشش ۹۹ زبان و شتاب ۲.۴ برابری، هزینه اجرای سرورها و مصرف حافظه گرافیکی را به کمترین میزان می‌رساند.

تبدیل صوت به متن با سرعت جت؛ نسخه بهینه‌شده ویسپر مدیوم ۲.۴ برابر سریع‌تر شد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم سیسترن (SYSTRAN) مدل محبوب ویسپر مدیوم اوپن‌ای‌آی را با موتور پرسرعت CTranslate2 بازنویسی کرد تا اجرای آن بسیار سریع‌تر و سبک‌تر شود.
  • این مدل ۷۶۹ میلیون پارامتری از ۹۹ زبان دنیا پشتیبانی می‌کند و با مصرف حافظه گرافیکی کمتر، متن گفتار را با کیفیتی عالی پیاده‌سازی می‌کند.
  • با پشتیبانی از حالت‌های پردازشی FP16 و INT8، هزینه‌های پردازش کاهش یافته و امکان اجرای روان آن روی کارت‌های گرافیک معمولی فراهم شده است.

سرعت سرسام‌آور در تبدیل صوت به متن چندزبانه

شرکت سیسترن (SYSTRAN) دست‌به‌کار جذابی زده و چک‌پوینت نسخه مدیوم مدل ویسپر (Whisper) اوپن‌ای‌آی رو به موتور CTranslate2 منتقل کرده؛ اتفاقی عالی که به توسعه‌دهنده‌ها اجازه میده همون مدل ۷۶۹ میلیون پارامتری پردازش گفتار رو با سرعت به‌مراتب بالاتر و مصرف حافظه بسیار کمتر اجرا کنن. این نسخه بهینه‌شده دقیقاً مناسب سیستم‌هایی طراحی شده که روی سرورهای محلی یا اختصاصی اجرا میشن؛ جاهایی که تأخیر پردازش، ظرفیت پاسخ‌دهی و هزینه رم کارت گرافیک اهمیت حیاتی داره.

مدل ویسپر مدیوم از ۹۹ زبان زنده دنیا پشتیبانی می‌کنه و در کنار پیاده‌سازی متن فایل‌های صوتی، امکان ترجمه هم‌زمان صوت به زبان انگلیسی رو هم در اختیارتون میذاره. این مدل از نظر اندازه، درست در نقطه تعادل میان نسخه‌های سبک (کم‌مصرف‌تر با دقت متوسط) و خانواده سنگین لارج (بسیار دقیق ولی با نیاز پردازشی بالا) قرار گرفته؛ ویژگی جذابی که اون رو به گزینه‌ای ایده‌آل و مقرون‌به‌صرفه برای ساخت زیرنویس، ثبت و پیاده‌سازی جلسات صوتی، ابزارهای دستیار صوتی و برچسب‌گذاری دیتاست‌ها تبدیل می‌کنه.

موتور CTranslate2 چطور سرعت اجرای مدل را متحول می‌کند؟

توسعه‌دهنده‌ها در این پروژه تمام وزن‌ها و پارامترهای آموزش‌دیده مدل اصلی اوپن‌ای‌آی رو به فرمت مخصوص CTranslate2 تبدیل کردن. این موتور استنتاج مدرن با به‌کارگیری کرنل‌های بهینه‌شده، کَش هوشمند دیکودر، ادغام عملیات محاسباتی و پردازش‌های کم‌دقت‌تر، بار پردازشی اضافه و سنگین زمان اجرا رو حسابی کاهش میده.

اجرای مدل در حالت FP16 بدون دستکاری پارامترها، خروجی و دقتی کاملاً مشابه نسخه اصلی ارائه میده؛ هرچند بسته به تنظیمات دیکود، دقت اعشاری و سخت‌افزار مورد استفاده، ممکنه جزئیات متن نهایی اندکی تفاوت داشته باشه. از طرف دیگه، استفاده از حالت INT8 مصرف حافظه گرافیکی رو باز هم کمتر می‌کنه؛ البته با هزینه اندکی در کاهش دقت که بهتره پیش از استفاده روی فایل‌های صوتی واقعی تست بشه.

اختلاف چشمگیر سرعت در آمار و بنچمارک‌ها

بر اساس بنچمارک‌های رسمی منتشرشده در پروژه faster-whisper، پیاده‌سازی و استخراج متن ۱۳ دقیقه فایل صوتی با مدل Whisper large-v2 روی یک کارت گرافیک NVIDIA GeForce RTX 3070 Ti با حافظه ۸ گیگابایت آزمایش شده است. هرچند این بنچمارک از مدل بزرگ‌تر لارج استفاده کرده، اما به وضوح نشان میده که موتور CTranslate2 تحت تنظیمات و شرایط کاملاً برابر دیکود، چطور عملکردی به مراتب چابک‌تر و کم‌مصرف‌تر نسبت به نسخه استاندارد به نمایش میذاره.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

ورود پر سر و صدای اوراکل به دنیای ایجنت‌ها؛ «فیوژن کلا» چطور مشکل گرانی و کندی هوش مصنوعی را حل می‌کند؟
آخرین اخبار

ورود پر سر و صدای اوراکل به دنیای ایجنت‌ها؛ «فیوژن کلا» چطور مشکل گرانی و کندی هوش مصنوعی را حل می‌کند؟

اوراکل با معرفی محیط اجرایی جدید «فیوژن کلا» (Fusion Claw)، شیوه کار ایجنت‌های هوش مصنوعی در شرکت‌های بزرگ را متحول کرده است. این فناوری با الهام از ایده اوپن‌کلا و جدا کردن مرحله تفکر هوش مصنوعی از محاسبات روزمره، هزینه‌های سنگین پردازش میلیون‌ها داده مالی و اداری را به نصف کاهش می‌دهد.

۹ دقیقه مطالعه
۰
۷ مهر
اسکرپینگ اخلاقی وب برای هوش مصنوعی؛ چطور بدون دردسر حقوقی دیتاست جمع کنیم؟
آخرین اخبار

اسکرپینگ اخلاقی وب برای هوش مصنوعی؛ چطور بدون دردسر حقوقی دیتاست جمع کنیم؟

جمع‌آوری داده برای آموزش مدل‌های هوش مصنوعی فقط نوشتن چند خط کد برای اسکرپ وب نیست؛ پای قوانین سفت‌وسخت حریم خصوصی و کپی‌رایت وسطه. اگر اصول اخلاقی مثل احترام به سرورها و پاکسازی اطلاعات شخصی رعایت نشه، هوش مصنوعی‌تون خیلی زود گرفتار عواقب قانونی سنگین و جریمه‌های دردسرساز می‌شه.

۶ دقیقه مطالعه
۰
۷ مهر
کابوس جریمه ۳۵ میلیون یورویی برای شرکت‌ها؛ قانون جدید هوش مصنوعی اروپا و چالشی که نادیده گرفته شده!
آخرین اخبار

کابوس جریمه ۳۵ میلیون یورویی برای شرکت‌ها؛ قانون جدید هوش مصنوعی اروپا و چالشی که نادیده گرفته شده!

با اجرایی شدن الزامات سفت‌وسخت قانون هوش مصنوعی اروپا، سازمان‌ها با تهدید جریمه‌های سنگین تا سقف ۳۵ میلیون یورو روبه‌رو هستند. اما مشکل اصلی شرکت‌ها کمبود اطلاعات نیست، بلکه ناتوانی در اثبات فرآیندهای نظارت و ردگیری عملکرد هوش مصنوعی در برابر قانون‌گذاران است.

۵ دقیقه مطالعه
۰
۷ مهر