کاهش ۹۵ درصدی هزینه API در مدل صوتی Qwen-Audio 3.1 شرکت Alibaba
تیم Qwen از نسخه Qwen-Audio 3.1 رونمایی کرد؛ یک پشته صوتی شامل پنج مدل پیشرفته برای تشخیص گفتار، تبدیل متن به گفتار و مکالمه بیدرنگ.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل Qwen-Audio 3.1 شرکت Alibaba با پنج نسخه مختلف برای پردازش صوت، تولید گفتار و مکالمه بیدرنگ معرفی شد.
- هزینههای API برای تشخیص گفتار تا ۹۵ درصد، مکالمه بیدرنگ ۸۵ درصد و تولید گفتار ۷۰ درصد کاهش یافته است.
- این مدل از ۲۶۲ هزار توکن در پنجره زمینه پشتیبانی میکند و فرآیند سه مرحلهای مکالمات صوتی را در یک سیستم یکپارچه ترکیب کرده است.
مدل Qwen-Audio 3.1 پشته صوتی Alibaba را گسترش داده و هزینههای API را کاهش میدهد
تیم Qwen در شرکت Alibaba نسخه Qwen-Audio 3.1 را منتشر کرد؛ بهروزرسانی مهمی که حوزههای تشخیص خودکار گفتار، تبدیل متن به گفتار و مکالمه دوطرفه کامل (full-duplex) را در بر میگیرد. این نسخه، مدلهای فعلی ASR، TTS و Realtime را ارتقا داده و دو مدل جدید ASR-Next برای تحلیل غنیتر صدا و TTS-Next برای تولید محتوای صوتی طولانی با ترکیب گفتار، جلوههای صوتی و صدای پسزمینه را معرفی میکند.
شرکت Alibaba از کاهش چشمگیر هزینههای API نسبت به قبل خبر میدهد:
- تبدیل متن به گفتار (TTS): حدود ۷۰ درصد.
- مکالمه بیدرنگ (Realtime): حدود ۸۵ درصد.
- تشخیص گفتار (ASR): تا ۹۵ درصد.
اکنون اپلیکیشنهای صوتی میتوانند پیادهسازی متن، تولید صدا و مدیریت نوبتهای مکالمه را از طریق یک مجموعه میزبانیشده یکپارچه انجام دهند. این امر میتواند حجم کارهای یکپارچهسازی را کاهش دهد؛ با این حال، مواردی نظیر تأخیر، کیفیت و ریسکهای وابستگی به تأمینکننده همچنان به ارزیابیهای دقیق در سطح نقطه پایانی (endpoint) نیاز دارند.
پنج مدل برای پوشش کامل چرخه صوتی
مدل | نقش اصلی | قابلیتهای کلیدی |
|---|---|---|
ASR | تبدیل گفتار به متن | تشخیص چندزبانه و لهجهها، همراه با یک مرحله پالایش برای حذف کلمات پرکننده و تکراری. |
ASR-Next | درک صوتی | تفکیک گویندگان (اختصاص بخشهای مختلف به هر گوینده)؛ برچسبگذاری زمانی؛ تشخیص احساسات؛ شناسایی صدای محیط و ماشین؛ کپشننویسی صوتی؛ و پاسخگویی به سؤالات صوتی. |
TTS | تولید گفتار | سنتز چندزبانه، انتقال صدای بینزبانی، و کنترل مبتنی بر دستورالعمل روی احساسات، سرعت، لهجه و سبک بیان. |
TTS-Next | تولید صوتی طولانی | یک سیستم یکپارچه زبانی و دیفیوژن که گفتار، جلوههای صوتی و صدای پسزمینه را در یک مرحله تولید میکند. |
Realtime | صدای مکالمهای | تعامل دوطرفه کامل (مدل میتواند همزمان با صحبت کردن، گوش دهد)، همراه با مدیریت قطع کلام و پاسخهای آگاه از احساسات. |
اجرای مدل TTS با توکنهای صوتی کمتر
مقاله فنی منتشرشده، بیشترین جزئیات را درباره مدل Qwen-Audio 3.1 TTS ارائه میدهد. توکنایزر با نرخ فریم پایین این مدل، گفتار را با سرعت ۱۲.۵ فریم بر ثانیه پردازش میکند که باعث کاهش تعداد واحدهایی میشود که مدل زبانی خودهمبسته (autoregressive) باید پیشبینی کند. سپس یک مؤلفه تطبیق جریان (flow-matching)، جزئیات آکوستیک لازم برای شکلموج نهایی را تولید میکند.
فرآیند آموزش پنج مرحلهای، تخصصگرایی اولیه را از بهینهسازی مشترک در مراحل بعدی جدا میکند:
- پیشآموزش مدل زبانی.
- پیشآموزش مدل تطبیق جریان.
- آموزش مشترک هر دو مؤلفه با تمرکز تدریجی بر دادههای باکیفیتتر.
- اعمال یادگیری تقویتی روی مدل زبانی.
- اعمال یادگیری تقویتی روی مدل تطبیق جریان.
شرکت Alibaba تأکید میکند که مراحل یادگیری تقویتی باعث بهبود نوای گفتار (prosody)، شباهت صدا و پایداری در برابر نمونههای ضبطشده چالشبرانگیز میشود. این مدل میتواند دستورالعملهای آزاد را برای تعیین نقش، احساسات، سرعت بیان، طنین، سبک و لهجه دریافت کند. افزون بر این، از ۸۶ برچسب درونخطی (inline tag) برای رویدادهای غیرکلامی مانند خنده، تنفس، سرفه و آه کشیدن پشتیبانی میکند.
پوشش زبانی این مدل به ۱۶ زبان و ۲۰ منطقه لهجه چینی گسترش یافته است. این سیستم قادر است تا سه دقیقه صدای پیوسته را در یک مرحله سنتز کند و گفتارهای مرجع حاوی نویز، پژواک یا تلفظ نامشخص را نیز بپذیرد.
یکپارچهسازی سه مرحله مجزا در مدل Realtime
مدل Qwen-Audio 3.1 Realtime Plus پنجره زمینه (context window) را به ۲۶۲,۱۴۴ توکن افزایش داده و از صدای دوطرفه کامل، فراخوانی تابع (function calling)، جستجوی وب و شبیهسازی صدا پشتیبانی میکند. این مدل میتواند صدا و متن را دریافت کرده و همزمان پاسخهای گفتاری و متنی را از طریق اتصالات بیدرنگ پایدار استریم کند.
ایجنتهای صوتی سنتی معمولاً هر نوبت از مکالمه را از طریق مسیر speech → ASR → text → language model → text → TTS → speech پردازش میکنند. اما این مدل یکپارچه، مراحل درک گفتار، استدلال و تولید را در یک سرویس واحد ترکیب کرده است. کاهش مرزهای پردازشی میتواند زمان تأخیر را کم کرده و مدیریت قطع کلام را سادهتر کند، به ویژه زمانی که کاربر میان صحبتهای ایجنت حرف میزند.
اپلیکیشنهایی که از قبل به Qwen-Audio 3.0 Realtime Plus متصل هستند، میتوانند پروتکل یکپارچهسازی قبلی را حفظ کنند؛ امری که تغییرات کد در زمان مهاجرت به نسخه جدید را محدود میکند. با این وجود، تیمهای توسعه همچنان نیازمند اجرای تستهای رگرسیون برای بررسی مدیریت نوبت مکالمه، فراخوانی ابزارها، کیفیت خروجی و مدیریت خطا هستند.
محدودیت ۲۶۲,۱۴۴ توکنی بیشتر به عنوان سقفی برای جلسات طولانی عمل میکند تا هدفی برای حفظ تمام تاریخچه. از آنجایی که صدای زنده، نتایج ابزارها و وضعیت مکالمه همگی بخشی از ظرفیت زمینه را مصرف میکنند، ایجنتهای دارای وضعیت (stateful) با طولانیتر شدن جلسات همچنان به سیستمهای خلاصهسازی، برش متن و کنترل تأخیر نیاز خواهند داشت.
کسب رتبه برتر همراه با محدودیتها
در ژوئیه ۲۰۲۶، مدل پیشین Qwen-Audio 3.0 TTS Plus با کسب امتیاز کیفی Elo برابر با ۱۲۳۷، رتبه نخست را در بنچمارک تبدیل متن به گفتار Artificial Analysis به دست آورد. سیستم Elo نتایج ترجیحات مقایسهای را خلاصه میکند و امتیاز بالاتر نشاندهنده ترجیح قویتر ارزیابان است. در این رقابت، مدل Qwen بالاتر از مدلهای Gemini 3.1 Flash TTS از شرکت Google، مدل MiniMax Speech 2.8 HD و Eleven v3 از شرکت ElevenLabs قرار گرفت.
مدل قبلی با قیمت ۲۷.۶۰ دلار به ازای هر یک میلیون کاراکتر عرضه میشد که حدود یکسوم تعرفههای مشابه در ElevenLabs و MiniMax بود. این نتیجه، پیشزمینه تاریخی مناسبی برای سری 3.1 فراهم میکند؛ هرچند نقاط پایانی (endpoints) جدید نیازمند اندازهگیریهای جداگانه برای کیفیت و تأخیر هستند.
در مقایسه منتشرشده، دو محدودیت نیز به ثبت رسیده است:
- توان عملیاتی (Throughput): مدل Qwen-Audio 3.0 TTS Plus حدود ۱۶ کاراکتر بر ثانیه تولید میکرد، در حالی که این رقم برای مدل Simba 3.2 برابر ۳۰.۲، برای Gemini 3.1 Flash TTS برابر ۲۷ و برای Sonic 3.5 برابر با ۱۲۰ کاراکتر بود.
- اطمینان آماری: برتری Qwen نسبت به Simba 3.2 در بازه اطمینان همپوشان قرار داشت که از نظر آماری باعث میشود دو نتیجه برتر مساوی در نظر گرفته شوند.
اولویت با دسترسی میزبانیشده
شرکت Alibaba در حال حاضر نقاط پایانی نسخه 3.1 را از طریق Alibaba Cloud Model Studio ارائه میدهد:
قابلیت | مدل یا پروژه | وضعیت دسترسی |
|---|---|---|
رونویسی فایل | qwen-audio-3.1-asr-flash-filetrans | API میزبانیشده |
مکالمه بیدرنگ | qwen-audio-3.1-realtime-plus | API میزبانیشده |
مدل TTS با وزنهای باز | مخزن Qwen3-TTS | مجوز Apache 2.0 |
درک صوتی پیشرفته | ASR-Next | بهزودی |
تولید صوتی یکپارچه | TTS-Next | بهزودی |
مخزن Qwen3-TTS که با وزنهای باز منتشر شده، به یک مسیر توسعه مجزا از سرویسهای میزبانیشده Qwen-Audio 3.x تعلق دارد؛ بنابراین توسعهدهندگان باید پیش از برنامهریزی برای مهاجرت، برابری ویژگیها و API را تأیید کنند. شرکت Alibaba هنوز تاریخ دقیقی برای عرضه مدلهای ASR-Next و TTS-Next اعلام نکرده است.
سه کاربرد عملیاتی
- ایجنتهای صوتی و اتوماسیون تلفنی. مدل Realtime Plus برای تماسهای پشتیبانی، سیستمهای رزرو و سایر مکالمات طولانی که به مدیریت قطع کلام، استفاده از ابزارها و وضعیت پایدار نیاز دارند، هدفگذاری شده است. پنجره زمینه بزرگتر، سقف جلسات را بالا میبرد، هرچند سیاستهای مدیریت حافظه در محیط پروداکشن همچنان الزامی است.
- کتابهای صوتی، دوبله و پادکست. مدل TTS Plus روی روایتگری و بیان کنترلشده تمرکز دارد. مدل TTS-Next این جریان کاری را به تولیداتی تعمیم میدهد که در همان مرحله نیازمند تولید گفتار، افکتها و صدای پسزمینه هستند.
- تحلیل جلسات و رسانهها. مدل ASR-Next برچسبهای گوینده، نشانگرهای زمانی، برچسبهای احساسی و تشخیص رویدادهای غیرکلامی را در یک فراخوانی واحد ترکیب میکند و نیاز به سرویسهای تخصصی متعدد برای فایلهای ضبطشده قابلجستجو را کاهش میدهد.
بنچمارکهای ضروری پیش از مهاجرت
آزمایشهای محیط پروداکشن باید رفتارهایی را بسنجند که رتبهبندیهای کلی و مشخصات ارائهشده از سوی تأمینکننده پاسخی برای آنها ندارند:
- تأخیر نوبت مکالمه: زمان تا دریافت اولین پاسخ صوتی، سرعت قطع مکالمه هنگام پریدن وسط حرف ایجنت، و تأخیر پاسخ p95 را در هر منطقه استقرار ثبت کنید.
- کیفیت در زبان هدف: خطاهای رونویسی، تلفظ، نوای گفتار و شباهت صدا را با استفاده از نمونههای دارای لهجه، گویشهای خاص و صداهای نویزدار اندازهگیری کنید.
- وفاداری متن پیادهسازیشده: بررسی کنید که مرحله پالایش ASR چگونه کلمات پرکننده و تکراری را مدیریت میکند، به خصوص زمانی که اپلیکیشن به سوابق کلمهبهکلمه نیاز دارد.
- پایداری ابزارها: دقت فراخوانی تابع (function-call) را در طول قطع کلام، همپوشانی گفتار و مکالمات طولانی ارزیابی کنید.
- رشد پنجره زمینه: مصرف توکن حاصل از صدا، متن و نتایج ابزارها را ردیابی کرده و سپس سیاستهایی برای خلاصهسازی و برش متن تعریف کنید.
- محدودیتهای عملیاتی: سقف پردازش همزمان، محدودیتهای نرخ درخواست (rate limits)، محل ذخیرهسازی دادهها، قوانین نگهداری و تدابیر امنیتی شبیهسازی صدا را تأیید کنید.
- هزینه کل: واحدهای صورتحساب تأمینکننده را با در نظر گرفتن مدت زمان واقعی تماس، کاراکترهای تولیدشده، تلاشهای مجدد و اوج ترافیک مدلسازی کنید.
تیمهای توسعه میتوانند ردپای فعلی سیستمهای پروداکشن خود را روی نقاط پایانی نسخه 3.1 اجرا کرده و نتایج را از نظر تأخیر، کیفیت، پایداری و هزینه بار کاری با تأمینکنندگان موجود مقایسه کنند. این اندازهگیریها مشخص خواهد کرد که آیا مدل یکپارچه میتواند جایگزین مناسبی برای یک پشته صوتی چندبخشی باشد یا خیر.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.