رونمایی Edge0 از Audio8 ASR Infinite؛ مدل هوش مصنوعی برای تبدیل ساعتها گفتار پیوسته به متن
استارتاپ Edge0 از مدل متنباز Audio8 ASR Infinite با ۴ میلیارد پارامتر تحت مجوز Apache 2.0 رونمایی کرد. این مدل تبدیل بلادرنگ گفتار به متن، با مدیریت پایدار حافظه و تشخیص هوشمند نوبت مکالمه، برای نشستهای صوتی طولانی و ایجنتهای صوتی توسعه یافته است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- انتشار مدل ۴ میلیارد پارامتری Audio8 ASR Infinite بهصورت متنباز و تحت مجوز Apache 2.0 توسط استارتاپ Edge0
- پشتیبانی از رونویسی نامحدود، تاخیر زیر ثانیه و مدیریت بهینه حافظه از طریق کش چرخان KV و بازتنظیم RoPE
- بهرهمندی از سیستم تشخیص معنایی پایان نوبت صحبت (Semantic VAD) برای تفکیک مکث فکری از پایان کلام در ایجنتهای صوتی
- امکان شخصیسازی ساعت صوتی (۸۰، ۱۲۰ یا ۱۶۰ میلیثانیه) جهت تنظیم تعادل میان تاخیر و دقت پردازش
هدفگذاری Audio8 ASR Infinite برای تبدیل ۲۴ ساعته گفتار به متن
شرکت Edge0 از مدل متنباز Audio8 ASR Infinite با ۴ میلیارد پارامتر تحت مجوز Apache 2.0 رونمایی کرد؛ مدلی برای تشخیص و تبدیل بلادرنگ گفتار به متن (Streaming ASR) که امکاناتی کاربردی را در اختیار توسعهدهندگان قرار میدهد. طبق اعلام این شرکت، مدل یادشده از رونویسی با مدتزمان نامحدود، تاخیر زیر ثانیه، مصرف محدود و کنترلشده حافظه و تشخیص معنایی پایان نوبت صحبت پشتیبانی میکند. این قابلیتها مشخصاً برای سرویسهایی طراحی شدهاند که میکروفون را ساعتها باز نگه میدارند؛ از جمله ابزارهای رونویسی جلسات، تحلیل تماسها و ایجنتهای صوتی دوطرفه همزمان (Full-Duplex).
توسعهدهندگان میتوانند فرکانس ساعت صوتی را روی ۸۰، ۱۲۰ یا ۱۶۰ میلیثانیه تنظیم کرده و تاخیر رونویسی را بین ۲۴۰ تا ۵۶۰ میلیثانیه مشخص کنند. به این ترتیب، یک چکپوینت واحد از چندین بودجهی تاخیر مختلف پشتیبانی میکند و به برنامهها اجازه میدهد بسته به نیاز خود در زمان اجرا، پاسخ سریعتر یا زمینه آکوستیک دقیقتر را ترجیح دهند.
چالش حفظ وضعیت در نشستهای طولانی
سیستمهای استریمینگ مبتنیبر تکهتکه کردن دادهها (Chunked)، قطعات کوتاه صوتی را پردازش کرده و خروجیهای آنها را به یکدیگر متصل میکنند؛ درحالیکه سیستمهای با حفظ وضعیت (Stateful)، زمینه مکالمه را بین مراحل متوالی حفظ مینمایند. در جلسات طولانی، وضعیتهای ذخیرهشده میتوانند حجم فزایندهای از حافظه را اشغال کنند و موقعیتیابها (Positional Encodings) از محدودههای دیدهشده در زمان آموزش فراتر روند؛ دو مشکلی که یا دقت مدل را کاهش میدهند یا نیاز به ریست دورهای سیستم را تحمیل میکنند.
مدل Audio8 تاریخچه توجه (Attention) خود را با یک کش کلید-مقدار چرخان (Rolling KV Cache) محدود میکند. این کش ۳۰ ثانیه از بافت متن و صدا را ذخیره کرده، دادههای قدیمیتر را دور میریزد و تعبیه موقعیتی چرخشی (RoPE) را که موقعیت توکنها را درون مکانیزم توجه رمزگذاری میکند، بهطور دقیق بازتنظیم (Re-basing) مینماید. این بازتنظیم، پس از هر بار جابهجایی کش، موقعیتها را مجدداً به محدوده عددی آشنای مدل بازمیگرداند.
- پنجره زمینه (Context Window): ۳۰ ثانیه وضعیت صوتی و متنی چرخان.
- مدیریت موقعیت: بازتنظیم دقیق RoPE پس از خروج زمینههای قدیمی از کش.
- نرخ تصمیمگیری: ۱۲٫۵، ۸٫۳ یا ۶٫۲۵ گام در ثانیه در ساعتهای صوتی ۸۰، ۱۲۰ یا ۱۶۰ میلیثانیهای.
- زمانبندی خروجی: امکان تولید یک توکن متنی در هر گام ساعتی.
تشخیص نوبت مکالمه فراتر از سکوت محض
سیستمهای سنتی تشخیص فعالیت صوتی (VAD)، معمولاً تنها وجود یا عدم وجود گفتار را تخمین میزنند و در نتیجه، سکوت را سیگنال اصلی پایان نوبت صحبت تلقی میکنند. اما Audio8 هدهای VAD معنایی (Semantic VAD) را به ساختار خود افزوده است تا پایان واقعی نوبت صحبت را از مکثهای ناشی از فکر کردن، تردید و لکنت زبان تشخیص دهد. ایجنتهای صوتی میتوانند از این پیشبینیها برای تصمیمگیری درباره زمان پاسخگویی، بدون اتکا به آستانه سکوت ثابت، استفاده کنند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.