پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی Edge0 از Audio8 ASR Infinite؛ مدل هوش مصنوعی برای تبدیل ساعت‌ها گفتار پیوسته به متن

انتشار:۳ مهر ۱۴۰۵(۳ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Edge0 از مدل متن‌باز Audio8 ASR Infinite با ۴ میلیارد پارامتر تحت مجوز Apache 2.0 رونمایی کرد. این مدل تبدیل بلادرنگ گفتار به متن، با مدیریت پایدار حافظه و تشخیص هوشمند نوبت مکالمه، برای نشست‌های صوتی طولانی و ایجنت‌های صوتی توسعه یافته است.

رونمایی Edge0 از Audio8 ASR Infinite؛ مدل هوش مصنوعی برای تبدیل ساعت‌ها گفتار پیوسته به متن

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • انتشار مدل ۴ میلیارد پارامتری Audio8 ASR Infinite به‌صورت متن‌باز و تحت مجوز Apache 2.0 توسط استارتاپ Edge0
  • پشتیبانی از رونویسی نامحدود، تاخیر زیر ثانیه و مدیریت بهینه حافظه از طریق کش چرخان KV و بازتنظیم RoPE
  • بهره‌مندی از سیستم تشخیص معنایی پایان نوبت صحبت (Semantic VAD) برای تفکیک مکث فکری از پایان کلام در ایجنت‌های صوتی
  • امکان شخصی‌سازی ساعت صوتی (۸۰، ۱۲۰ یا ۱۶۰ میلی‌ثانیه) جهت تنظیم تعادل میان تاخیر و دقت پردازش

هدف‌گذاری Audio8 ASR Infinite برای تبدیل ۲۴ ساعته گفتار به متن

شرکت Edge0 از مدل متن‌باز Audio8 ASR Infinite با ۴ میلیارد پارامتر تحت مجوز Apache 2.0 رونمایی کرد؛ مدلی برای تشخیص و تبدیل بلادرنگ گفتار به متن (Streaming ASR) که امکاناتی کاربردی را در اختیار توسعه‌دهندگان قرار می‌دهد. طبق اعلام این شرکت، مدل یادشده از رونویسی با مدت‌زمان نامحدود، تاخیر زیر ثانیه، مصرف محدود و کنترل‌شده حافظه و تشخیص معنایی پایان نوبت صحبت پشتیبانی می‌کند. این قابلیت‌ها مشخصاً برای سرویس‌هایی طراحی شده‌اند که میکروفون را ساعت‌ها باز نگه می‌دارند؛ از جمله ابزارهای رونویسی جلسات، تحلیل تماس‌ها و ایجنت‌های صوتی دوطرفه هم‌زمان (Full-Duplex).

توسعه‌دهندگان می‌توانند فرکانس ساعت صوتی را روی ۸۰، ۱۲۰ یا ۱۶۰ میلی‌ثانیه تنظیم کرده و تاخیر رونویسی را بین ۲۴۰ تا ۵۶۰ میلی‌ثانیه مشخص کنند. به این ترتیب، یک چک‌پوینت واحد از چندین بودجه‌ی تاخیر مختلف پشتیبانی می‌کند و به برنامه‌ها اجازه می‌دهد بسته به نیاز خود در زمان اجرا، پاسخ سریع‌تر یا زمینه آکوستیک دقیق‌تر را ترجیح دهند.

چالش حفظ وضعیت در نشست‌های طولانی

سیستم‌های استریمینگ مبتنی‌بر تکه‌تکه کردن داده‌ها (Chunked)، قطعات کوتاه صوتی را پردازش کرده و خروجی‌های آن‌ها را به یکدیگر متصل می‌کنند؛ درحالی‌که سیستم‌های با حفظ وضعیت (Stateful)، زمینه مکالمه را بین مراحل متوالی حفظ می‌نمایند. در جلسات طولانی، وضعیت‌های ذخیره‌شده می‌توانند حجم فزاینده‌ای از حافظه را اشغال کنند و موقعیت‌یاب‌ها (Positional Encodings) از محدوده‌های دیده‌شده در زمان آموزش فراتر روند؛ دو مشکلی که یا دقت مدل را کاهش می‌دهند یا نیاز به ریست دوره‌ای سیستم را تحمیل می‌کنند.

مدل Audio8 تاریخچه توجه (Attention) خود را با یک کش کلید-مقدار چرخان (Rolling KV Cache) محدود می‌کند. این کش ۳۰ ثانیه از بافت متن و صدا را ذخیره کرده، داده‌های قدیمی‌تر را دور می‌ریزد و تعبیه موقعیتی چرخشی (RoPE) را که موقعیت توکن‌ها را درون مکانیزم توجه رمزگذاری می‌کند، به‌طور دقیق بازتنظیم (Re-basing) می‌نماید. این بازتنظیم، پس از هر بار جابه‌جایی کش، موقعیت‌ها را مجدداً به محدوده عددی آشنای مدل بازمی‌گرداند.

  • پنجره زمینه (Context Window): ۳۰ ثانیه وضعیت صوتی و متنی چرخان.
  • مدیریت موقعیت: بازتنظیم دقیق RoPE پس از خروج زمینه‌های قدیمی از کش.
  • نرخ تصمیم‌گیری: ۱۲٫۵، ۸٫۳ یا ۶٫۲۵ گام در ثانیه در ساعت‌های صوتی ۸۰، ۱۲۰ یا ۱۶۰ میلی‌ثانیه‌ای.
  • زمان‌بندی خروجی: امکان تولید یک توکن متنی در هر گام ساعتی.

تشخیص نوبت مکالمه فراتر از سکوت محض

سیستم‌های سنتی تشخیص فعالیت صوتی (VAD)، معمولاً تنها وجود یا عدم وجود گفتار را تخمین می‌زنند و در نتیجه، سکوت را سیگنال اصلی پایان نوبت صحبت تلقی می‌کنند. اما Audio8 هدهای VAD معنایی (Semantic VAD) را به ساختار خود افزوده است تا پایان واقعی نوبت صحبت را از مکث‌های ناشی از فکر کردن، تردید و لکنت زبان تشخیص دهد. ایجنت‌های صوتی می‌توانند از این پیش‌بینی‌ها برای تصمیم‌گیری درباره زمان پاسخ‌گویی، بدون اتکا به آستانه سکوت ثابت، استفاده کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر