پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

کاهش ۹۵ درصدی هزینه API در مدل صوتی Qwen-Audio 3.1 شرکت Alibaba

انتشار:۱ مهر ۱۴۰۵(۵ روز پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

تیم Qwen از نسخه Qwen-Audio 3.1 رونمایی کرد؛ یک پشته صوتی شامل پنج مدل پیشرفته برای تشخیص گفتار، تبدیل متن به گفتار و مکالمه بی‌درنگ.

کاهش ۹۵ درصدی هزینه API در مدل صوتی Qwen-Audio 3.1 شرکت Alibaba

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل Qwen-Audio 3.1 شرکت Alibaba با پنج نسخه مختلف برای پردازش صوت، تولید گفتار و مکالمه بی‌درنگ معرفی شد.
  • هزینه‌های API برای تشخیص گفتار تا ۹۵ درصد، مکالمه بی‌درنگ ۸۵ درصد و تولید گفتار ۷۰ درصد کاهش یافته است.
  • این مدل از ۲۶۲ هزار توکن در پنجره زمینه پشتیبانی می‌کند و فرآیند سه مرحله‌ای مکالمات صوتی را در یک سیستم یکپارچه ترکیب کرده است.

مدل Qwen-Audio 3.1 پشته صوتی Alibaba را گسترش داده و هزینه‌های API را کاهش می‌دهد

تیم Qwen در شرکت Alibaba نسخه Qwen-Audio 3.1 را منتشر کرد؛ به‌روزرسانی مهمی که حوزه‌های تشخیص خودکار گفتار، تبدیل متن به گفتار و مکالمه دوطرفه کامل (full-duplex) را در بر می‌گیرد. این نسخه، مدل‌های فعلی ASR، TTS و Realtime را ارتقا داده و دو مدل جدید ASR-Next برای تحلیل غنی‌تر صدا و TTS-Next برای تولید محتوای صوتی طولانی با ترکیب گفتار، جلوه‌های صوتی و صدای پس‌زمینه را معرفی می‌کند.

شرکت Alibaba از کاهش چشمگیر هزینه‌های API نسبت به قبل خبر می‌دهد:

  • تبدیل متن به گفتار (TTS): حدود ۷۰ درصد.
  • مکالمه بی‌درنگ (Realtime): حدود ۸۵ درصد.
  • تشخیص گفتار (ASR): تا ۹۵ درصد.

اکنون اپلیکیشن‌های صوتی می‌توانند پیاده‌سازی متن، تولید صدا و مدیریت نوبت‌های مکالمه را از طریق یک مجموعه میزبانی‌شده یکپارچه انجام دهند. این امر می‌تواند حجم کارهای یکپارچه‌سازی را کاهش دهد؛ با این حال، مواردی نظیر تأخیر، کیفیت و ریسک‌های وابستگی به تأمین‌کننده همچنان به ارزیابی‌های دقیق در سطح نقطه پایانی (endpoint) نیاز دارند.

پنج مدل برای پوشش کامل چرخه صوتی

مدل
نقش اصلی
قابلیت‌های کلیدی
ASR
تبدیل گفتار به متن
تشخیص چندزبانه و لهجه‌ها، همراه با یک مرحله پالایش برای حذف کلمات پرکننده و تکراری.
ASR-Next
درک صوتی
تفکیک گویندگان (اختصاص بخش‌های مختلف به هر گوینده)؛ برچسب‌گذاری زمانی؛ تشخیص احساسات؛ شناسایی صدای محیط و ماشین؛ کپشن‌نویسی صوتی؛ و پاسخگویی به سؤالات صوتی.
TTS
تولید گفتار
سنتز چندزبانه، انتقال صدای بین‌زبانی، و کنترل مبتنی بر دستورالعمل روی احساسات، سرعت، لهجه و سبک بیان.
TTS-Next
تولید صوتی طولانی
یک سیستم یکپارچه زبانی و دیفیوژن که گفتار، جلوه‌های صوتی و صدای پس‌زمینه را در یک مرحله تولید می‌کند.
Realtime
صدای مکالمه‌ای
تعامل دوطرفه کامل (مدل می‌تواند همزمان با صحبت کردن، گوش دهد)، همراه با مدیریت قطع کلام و پاسخ‌های آگاه از احساسات.

اجرای مدل TTS با توکن‌های صوتی کمتر

مقاله فنی منتشرشده، بیشترین جزئیات را درباره مدل Qwen-Audio 3.1 TTS ارائه می‌دهد. توکنایزر با نرخ فریم پایین این مدل، گفتار را با سرعت ۱۲.۵ فریم بر ثانیه پردازش می‌کند که باعث کاهش تعداد واحدهایی می‌شود که مدل زبانی خودهمبسته (autoregressive) باید پیش‌بینی کند. سپس یک مؤلفه تطبیق جریان (flow-matching)، جزئیات آکوستیک لازم برای شکل‌موج نهایی را تولید می‌کند.

فرآیند آموزش پنج مرحله‌ای، تخصص‌گرایی اولیه را از بهینه‌سازی مشترک در مراحل بعدی جدا می‌کند:

  1. پیش‌آموزش مدل زبانی.
  2. پیش‌آموزش مدل تطبیق جریان.
  3. آموزش مشترک هر دو مؤلفه با تمرکز تدریجی بر داده‌های باکیفیت‌تر.
  4. اعمال یادگیری تقویتی روی مدل زبانی.
  5. اعمال یادگیری تقویتی روی مدل تطبیق جریان.

شرکت Alibaba تأکید می‌کند که مراحل یادگیری تقویتی باعث بهبود نوای گفتار (prosody)، شباهت صدا و پایداری در برابر نمونه‌های ضبط‌شده چالش‌برانگیز می‌شود. این مدل می‌تواند دستورالعمل‌های آزاد را برای تعیین نقش، احساسات، سرعت بیان، طنین، سبک و لهجه دریافت کند. افزون بر این، از ۸۶ برچسب درون‌خطی (inline tag) برای رویدادهای غیرکلامی مانند خنده، تنفس، سرفه و آه کشیدن پشتیبانی می‌کند.

پوشش زبانی این مدل به ۱۶ زبان و ۲۰ منطقه لهجه چینی گسترش یافته است. این سیستم قادر است تا سه دقیقه صدای پیوسته را در یک مرحله سنتز کند و گفتارهای مرجع حاوی نویز، پژواک یا تلفظ نامشخص را نیز بپذیرد.

یکپارچه‌سازی سه مرحله مجزا در مدل Realtime

مدل Qwen-Audio 3.1 Realtime Plus پنجره زمینه (context window) را به ۲۶۲,۱۴۴ توکن افزایش داده و از صدای دوطرفه کامل، فراخوانی تابع (function calling)، جستجوی وب و شبیه‌سازی صدا پشتیبانی می‌کند. این مدل می‌تواند صدا و متن را دریافت کرده و همزمان پاسخ‌های گفتاری و متنی را از طریق اتصالات بی‌درنگ پایدار استریم کند.

ایجنت‌های صوتی سنتی معمولاً هر نوبت از مکالمه را از طریق مسیر speech → ASR → text → language model → text → TTS → speech پردازش می‌کنند. اما این مدل یکپارچه، مراحل درک گفتار، استدلال و تولید را در یک سرویس واحد ترکیب کرده است. کاهش مرزهای پردازشی می‌تواند زمان تأخیر را کم کرده و مدیریت قطع کلام را ساده‌تر کند، به ویژه زمانی که کاربر میان صحبت‌های ایجنت حرف می‌زند.

اپلیکیشن‌هایی که از قبل به Qwen-Audio 3.0 Realtime Plus متصل هستند، می‌توانند پروتکل یکپارچه‌سازی قبلی را حفظ کنند؛ امری که تغییرات کد در زمان مهاجرت به نسخه جدید را محدود می‌کند. با این وجود، تیم‌های توسعه همچنان نیازمند اجرای تست‌های رگرسیون برای بررسی مدیریت نوبت مکالمه، فراخوانی ابزارها، کیفیت خروجی و مدیریت خطا هستند.

محدودیت ۲۶۲,۱۴۴ توکنی بیشتر به عنوان سقفی برای جلسات طولانی عمل می‌کند تا هدفی برای حفظ تمام تاریخچه. از آنجایی که صدای زنده، نتایج ابزارها و وضعیت مکالمه همگی بخشی از ظرفیت زمینه را مصرف می‌کنند، ایجنت‌های دارای وضعیت (stateful) با طولانی‌تر شدن جلسات همچنان به سیستم‌های خلاصه‌سازی، برش متن و کنترل تأخیر نیاز خواهند داشت.

کسب رتبه برتر همراه با محدودیت‌ها

در ژوئیه ۲۰۲۶، مدل پیشین Qwen-Audio 3.0 TTS Plus با کسب امتیاز کیفی Elo برابر با ۱۲۳۷، رتبه نخست را در بنچمارک تبدیل متن به گفتار Artificial Analysis به دست آورد. سیستم Elo نتایج ترجیحات مقایسه‌ای را خلاصه می‌کند و امتیاز بالاتر نشان‌دهنده ترجیح قوی‌تر ارزیابان است. در این رقابت، مدل Qwen بالاتر از مدل‌های Gemini 3.1 Flash TTS از شرکت Google، مدل MiniMax Speech 2.8 HD و Eleven v3 از شرکت ElevenLabs قرار گرفت.

مدل قبلی با قیمت ۲۷.۶۰ دلار به ازای هر یک میلیون کاراکتر عرضه می‌شد که حدود یک‌سوم تعرفه‌های مشابه در ElevenLabs و MiniMax بود. این نتیجه، پیش‌زمینه تاریخی مناسبی برای سری 3.1 فراهم می‌کند؛ هرچند نقاط پایانی (endpoints) جدید نیازمند اندازه‌گیری‌های جداگانه برای کیفیت و تأخیر هستند.

در مقایسه منتشرشده، دو محدودیت نیز به ثبت رسیده است:

  • توان عملیاتی (Throughput): مدل Qwen-Audio 3.0 TTS Plus حدود ۱۶ کاراکتر بر ثانیه تولید می‌کرد، در حالی که این رقم برای مدل Simba 3.2 برابر ۳۰.۲، برای Gemini 3.1 Flash TTS برابر ۲۷ و برای Sonic 3.5 برابر با ۱۲۰ کاراکتر بود.
  • اطمینان آماری: برتری Qwen نسبت به Simba 3.2 در بازه اطمینان هم‌پوشان قرار داشت که از نظر آماری باعث می‌شود دو نتیجه برتر مساوی در نظر گرفته شوند.

اولویت با دسترسی میزبانی‌شده

شرکت Alibaba در حال حاضر نقاط پایانی نسخه 3.1 را از طریق Alibaba Cloud Model Studio ارائه می‌دهد:

قابلیت
مدل یا پروژه
وضعیت دسترسی
رونویسی فایل
qwen-audio-3.1-asr-flash-filetrans
API میزبانی‌شده
مکالمه بی‌درنگ
qwen-audio-3.1-realtime-plus
API میزبانی‌شده
مدل TTS با وزن‌های باز
مخزن Qwen3-TTS
مجوز Apache 2.0
درک صوتی پیشرفته
ASR-Next
به‌زودی
تولید صوتی یکپارچه
TTS-Next
به‌زودی

مخزن Qwen3-TTS که با وزن‌های باز منتشر شده، به یک مسیر توسعه مجزا از سرویس‌های میزبانی‌شده Qwen-Audio 3.x تعلق دارد؛ بنابراین توسعه‌دهندگان باید پیش از برنامه‌ریزی برای مهاجرت، برابری ویژگی‌ها و API را تأیید کنند. شرکت Alibaba هنوز تاریخ دقیقی برای عرضه مدل‌های ASR-Next و TTS-Next اعلام نکرده است.

سه کاربرد عملیاتی

  1. ایجنت‌های صوتی و اتوماسیون تلفنی. مدل Realtime Plus برای تماس‌های پشتیبانی، سیستم‌های رزرو و سایر مکالمات طولانی که به مدیریت قطع کلام، استفاده از ابزارها و وضعیت پایدار نیاز دارند، هدف‌گذاری شده است. پنجره زمینه بزرگ‌تر، سقف جلسات را بالا می‌برد، هرچند سیاست‌های مدیریت حافظه در محیط پروداکشن همچنان الزامی است.
  2. کتاب‌های صوتی، دوبله و پادکست. مدل TTS Plus روی روایت‌گری و بیان کنترل‌شده تمرکز دارد. مدل TTS-Next این جریان کاری را به تولیداتی تعمیم می‌دهد که در همان مرحله نیازمند تولید گفتار، افکت‌ها و صدای پس‌زمینه هستند.
  3. تحلیل جلسات و رسانه‌ها. مدل ASR-Next برچسب‌های گوینده، نشانگرهای زمانی، برچسب‌های احساسی و تشخیص رویدادهای غیرکلامی را در یک فراخوانی واحد ترکیب می‌کند و نیاز به سرویس‌های تخصصی متعدد برای فایل‌های ضبط‌شده قابل‌جستجو را کاهش می‌دهد.

بنچمارک‌های ضروری پیش از مهاجرت

آزمایش‌های محیط پروداکشن باید رفتارهایی را بسنجند که رتبه‌بندی‌های کلی و مشخصات ارائه‌شده از سوی تأمین‌کننده پاسخی برای آن‌ها ندارند:

  • تأخیر نوبت مکالمه: زمان تا دریافت اولین پاسخ صوتی، سرعت قطع مکالمه هنگام پریدن وسط حرف ایجنت، و تأخیر پاسخ p95 را در هر منطقه استقرار ثبت کنید.
  • کیفیت در زبان هدف: خطاهای رونویسی، تلفظ، نوای گفتار و شباهت صدا را با استفاده از نمونه‌های دارای لهجه، گویش‌های خاص و صداهای نویزدار اندازه‌گیری کنید.
  • وفاداری متن پیاده‌سازی‌شده: بررسی کنید که مرحله پالایش ASR چگونه کلمات پرکننده و تکراری را مدیریت می‌کند، به خصوص زمانی که اپلیکیشن به سوابق کلمه‌به‌کلمه نیاز دارد.
  • پایداری ابزارها: دقت فراخوانی تابع (function-call) را در طول قطع کلام، همپوشانی گفتار و مکالمات طولانی ارزیابی کنید.
  • رشد پنجره زمینه: مصرف توکن حاصل از صدا، متن و نتایج ابزارها را ردیابی کرده و سپس سیاست‌هایی برای خلاصه‌سازی و برش متن تعریف کنید.
  • محدودیت‌های عملیاتی: سقف پردازش همزمان، محدودیت‌های نرخ درخواست (rate limits)، محل ذخیره‌سازی داده‌ها، قوانین نگهداری و تدابیر امنیتی شبیه‌سازی صدا را تأیید کنید.
  • هزینه کل: واحدهای صورت‌حساب تأمین‌کننده را با در نظر گرفتن مدت زمان واقعی تماس، کاراکترهای تولیدشده، تلاش‌های مجدد و اوج ترافیک مدل‌سازی کنید.

تیم‌های توسعه می‌توانند ردپای فعلی سیستم‌های پروداکشن خود را روی نقاط پایانی نسخه 3.1 اجرا کرده و نتایج را از نظر تأخیر، کیفیت، پایداری و هزینه بار کاری با تأمین‌کنندگان موجود مقایسه کنند. این اندازه‌گیری‌ها مشخص خواهد کرد که آیا مدل یکپارچه می‌تواند جایگزین مناسبی برای یک پشته صوتی چندبخشی باشد یا خیر.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر