رکوردشکنی ElevenLabs با مدل جدید Eleven v4؛ پادشاه جدید هوش مصنوعی صوتی انگلیسی!
شرکت ElevenLabs با معرفی مدل صوتی Eleven v4 و ثبت امتیاز کمنظیر ۹۱.۷ درصدی در دقت تلفظ، به صدر جدول هوش مصنوعی صوتی انگلیسی تکیه زد. این مدل قدرتمند با پشت سر گذاشتن رقبای نامآشنایی مثل جمینای گوگل، در دو نسخه پرچمدار و توربو برای روایت داستان، تولید محتوا و اجرای ایجنتهای صوتی بیدرنگ عرضه شده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل صوتی جدید Eleven v4 با پشت سر گذاشتن رقبای نامداری مثل جمینای گوگل و کارتیزیا سونیک، به صدر جدول هوش مصنوعی تبدیل متن به گفتار انگلیسی رسید.
- این مدل در بخش پایداری و صحت تلفظ کلمات سخت و عبارات تخصصی به امتیاز کمنظیر ۹۱.۷ درصدی دست یافته که رکوردی تازه در این صنعت محسوب میشود.
- با وجود کیفیت خیرهکننده، هزینه بالای ۸۰ دلاری به ازای هر میلیون کاراکتر و تسلط رقیبش (Sonic 3.6) در زبانهای غیرانگلیسی، انتخاب میان گزینهها را به نوع پروژه وابسته میکند.
صدرنشینی Eleven v4 در تبدیل متن به گفتار انگلیسی؛ کیفیت عالی اما گرانقیمت
بر اساس تازهترین ردهبندی بنچمارک معتبر Provider Voice Arena در مجموعه Artificial Analysis، مدل Eleven v4 توانسته در صدر جدول برترین مدلهای تبدیل متن به گفتار (TTS) زبان انگلیسی قرار بگیرد. این مدل جدید بالاتر از رقبای سرسختی چون Sonic 3.6 از شرکت Cartesia و همچنین Gemini 3.8 Flash TTS گوگل نشسته و بالاترین امتیاز ترکیبی پایداری و دقت تلفظ را در تاریخ این بنچمارک به نام خود ثبت کرده است.
شرکت ElevenLabs دو نسخه متفاوت از این مدل را برای کاربردهای گوناگون راهی بازار کرده است: نسخه پرچمدار v4 که مخصوص روایت داستان، صداپیشگی و اجرای نقش شخصیتهاست، و نسخه توربو (Turbo) که با تمرکز ویژه روی کاهش تأخیر، برای ایجنتهای صوتی آنی و زنده توسعه یافته است. طبق گزارش تککرانچ، هر دو نسخه امکان کنترل لحن و حس گوینده را ارتقا دادهاند و حالا به جای حدود ۷۰ زبان در نسخه قبلی، از بیش از ۹۰ زبان مختلف پشتیبانی میکنند.
صداهای پیشفرض و اختصاصی؛ برگ برنده نسخه چهارم
بنچمارک Provider Voice Arena عملکرد هر مدل را با صداهای پیشفرض و تنظیمات کارخانهای آن ارزیابی میکند. امتیاز Elo در واقع بازتابدهنده انتخاب کاربران در مقایسههای رودررو است؛ یعنی هر چه امتیاز بالاتر باشد، نشان میدهد شنوندگان صدای آن مدل را طبیعیتر و دلنشینتر دانستهاند.
رتبه | مدل | امتیاز Elo |
|---|---|---|
۱ | Eleven v4 | ۱,۳۱۹ |
۲ | Cartesia Sonic 3.6 | ۱,۲۷۶ |
۳ | Gemini 3.8 Flash TTS | ۱,۲۶۷ |
امتیاز درخشان Eleven v4 حاصل ارزیابی ۱,۶۷۴ نمونه صوتی مختلف است. جالب اینکه این مدل در هر چهار دستهبندی اصلی این ارزیابی، یعنی خدمات مشتریان، دستیارهای مجازی، انتقال دانش و بخش سرگرمی، رتبه نخست را از آن خود کرده است.
در مقابل، جدول دیگری به نام Controlled Voice وجود دارد که برای سنجش بیطرفانه، یک صدای کلونشده یکسان را روی همه سیستمها پخش میکند تا برتری آرشیو صوتی خود شرکتها نقشی در نتیجه نداشته باشد. در این بخش، Eleven v4 با امتیاز ۱,۱۵۷ در جایگاه دوم ایستاده و پشت سر مدل Qwen-Audio-3.1-TTS-Plus شرکت علیبابا (با امتیاز ۱,۱۷۸) قرار گرفته است. این موضوع نشان میدهد صداهای پیشفرض و بهینهسازیهای اختصاصی ElevenLabs نقش پررنگی در صدرنشینی آن در جدول اصلی داشتهاند.
باید در نظر داشت که امتیازهای Elo رتبهبندیهای نسبی هستند نه درصد مطلق کیفیت، و با ثبت آرای بیشتر کاربران ممکن است تغییر کنند. بنابراین اختلاف ۲۱ امتیازی در جدول صدای کنترلشده، به این معناست که تیمها باید خودشان کیفیت را تست عملی کنند و تنها به جدول اتکا نکنند.
رسیدن به دقت تلفظ ۹۱.۷ درصدی؛ خداحافظی با تپقهای ماشینی
مدلهای صوتی هوش مصنوعی معمولاً موقع خواندن مخففها، اصطلاحات پیچیده علمی، کلماتی که تلفظشان وابسته به لحن جمله است و رشتههای طولانی از اعداد (مثل شماره سفارش) حسابی تپق میزنند. مجموعه Artificial Analysis برای سنجش همین موضوع، از شنوندگان انسانی کمک میگیرد تا فایلهای صوتی تولیدشده را با تلفظ استاندارد مقایسه کنند.
دستهبندی ارزیابی | موضوع تست | نتیجه Eleven v4 | وضعیت رقبا و نسخههای قبلی |
|---|---|---|---|
باز کردن و ادای درست مخففها | خواندن دقیق و صحیح کلمات اختصاری | ۹۴.۱٪ | نسخه v3 امتیاز ۸۲.۷٪ گرفته بود |
تلفظ مناسب بر اساس متن و لحن جمله | تشخیص درست تلفظ از بافت جمله | ۹۴.۱٪ | جمینای ۳.۸ فلش با ۹۷.۹٪ صدرنشین است |
کلمات و اصطلاحات منفرد | خواندن اصطلاحات خاص بدون قرارگیری در جمله | ۹۳.۲٪ | نسخه مکالمهای v3 با ۹۵.۱٪ صدرنشین است |
حفظ دقیق دنباله حروف و اعداد | خواندن دقیق شناسهها، کدها و رشتههای عددی | ۷۸.۸٪ | نسخه v3 امتیاز ۷۱.۲٪ داشت؛ مدل SpaceXAI با ۸۵.۷٪ اول است |
امتیاز کلی ۹۱.۷ درصدی، بالاترین رکوردی است که تاکنون برای یک مدل تبدیل متن به گفتار در این بنچمارک ثبت شده است. علاوه بر این، Eleven v4 تنها مدلی است که توانسته در سه بخش از چهار بخش، امتیازی بالای ۹۳ درصد به دست آورد.
با این حال، خواندن دقیق رشتههای طولانی و کاراکترهای پیدرپی با دقت ۷۸.۸ درصد، همچنان پاشنه آشیل این مدل به حساب میآید. بنابراین سرویسهایی که با کدهای رهگیری، اصطلاحات خاص دارویی و پزشکی، شناسههای حساب کاربری یا شماره سریال کالاها سر و کار دارند، حتماً قبل از استفاده در محیط عملیاتی باید تستهای دقیقی انجام دهند و گزینههای جایگزین در نظر بگیرند.
افزایش چشمگیر سرعت همگام با قیمت نجومی
طبق بررسیها، سرعت پردازش Eleven v4 به ۷۳.۴ کاراکتر در ثانیه رسیده که جهش بزرگی نسبت به سرعت ۴۲.۵ کاراکتری نسخه قبلی (v3) است. البته این عدد صرفاً سرعت خود موتور صوتی را نشان میدهد و شامل تأخیر شبکه اینترنت، زمان پاسخگویی مدل زبانی یا پخش فایل صوتی در سمت کاربر نمیشود.
مدل | قیمت هر یک میلیون کاراکتر | نسبت هزینه در مقایسه با v4 |
|---|---|---|
Eleven v4 | ۸۰ دلار | ۱۰۰٪ |
Cartesia Sonic 3.6 | ۴۹ دلار | ۶۱٪ |
Gemini 3.8 Flash TTS | ۱۶.۴۹ دلار | ۲۱٪ |
با قیمتهای استاندارد فعلی، استفاده از Eleven v4 تقریباً ۱.۶ برابر گرانتر از Sonic 3.6 و حدود ۴.۹ برابر گرانتر از Gemini 3.8 Flash TTS آب میخورد. البته این تعرفهها بسته به پلنهای اشتراکی و حجم مصرف ممکن است دستخوش تخفیف شوند.
الونلبز برای دو هفته ابتدایی عرضه، تخفیف ویژهای در نظر گرفته که قیمت v4 را به ۲۲ دلار و قیمت نسخه توربو را به ۱۱ دلار به ازای هر میلیون کاراکتر کاهش میدهد. همچنین کاربران واجد شرایط طرح Creator+ میتوانند در سقف اعتبار ماهانه خود بدون پرداخت هزینه اضافی از v4 استفاده کنند؛ هرچند پس از اتمام دوره تبلیغاتی، همان نرخ پایه و سنگین ۸۰ دلار محاسبه خواهد شد.
تغییرات اساسی در کلون صدا و لزوم آموزش مجدد
شرکت ElevenLabs معماری بخش کلون و شبیهسازی صدا را در نسخه چهارم از نو بازنویسی کرده است. قابلیت «کلون آنی» حالا میتواند تنها با یک فایل ضبطشده ۱۰ ثانیهای صدایی بسیار شبیه بسازد و گزینه «کلون حرفهای» نیز که در نسخه v3 غایب بود، دوباره بازگشته است. این شرکت ادعا میکند کلون آنی v4 کیفیتی حتی بالاتر از کلون حرفهای در نسخه چندزبانه قبلی (Multilingual v2) دارد، اگرچه این ادعا هنوز توسط تستهای مستقل عمومی راستیآزمایی نشده است.
نکته مهم برای توسعهدهندگان این است که صداهای کلونشده قدیمی (چه آنی و چه حرفهای) برای کارکرد بهینه روی این نسخه جدید، نیاز به آموزش مجدد (Retraining) دارند. البته برنامههایی که از API این شرکت استفاده میکنند، خیلی راحت و صرفاً با تغییر شناسه مدل میتوانند از نسخه جدید بهره ببرند:
const audio = await elevenlabs.textToSpeech.convert(
's3TPKV1kjDlVtZbl4Ksh',
{
text: 'The first move is what sets everything in motion.',
modelId: 'eleven_v4'
}
);با این حال، آپدیت کد به تنهایی کافی نیست و فرآیند آموزش مجدد صداها باید به صورت جداگانه انجام شود. به تیمهای فنی توصیه میشود قبل از انتقال ترافیک اصلی کاربران، لحن، سرعت، ثبات و یکدستی صداهای جدید را با نسخههای قبلی مقایسه کنند.
از سوی دیگر، نسخه توربو زمان پاسخگویی فوقالعادهای دارد؛ میانه زمان تولید اولین بخش صدا (Time to First Speech) تنها ۱۵۰ میلیثانیه اعلام شده و از استریم دوطرفه دادهها هم پشتیبانی میکند. البته باید توجه داشت که تأخیر نهایی ایجنتهای صوتی، به عواملی مثل کیفیت شبکه، سرعت تولید متن توسط مدل هوش مصنوعی و بافر سیستم پخش کاربر نیز بستگی دارد.
برتری در انگلیسی؛ رقابت داغ در سایر زبانها
صدرنشینی بیچونوچرای مدل جدید ElevenLabs در حال حاضر فقط مربوط به زبان انگلیسی است. مدل Sonic 3.6 متعلق به شرکت Cartesia همچنان در ۸ زبان از ۹ زبان غیرانگلیسی ارزیابیشده در صدر قرار دارد؛ هرچند که Eleven v4 مدعی پشتیبانی از بیش از ۹۰ زبان مختلف است.
علاوه بر این، شرکتهای سرشناسی مانند Deepgram، Fish Audio، Boson، WellSaid Labs، گوگل و اوپنایآی به همراه مدلهای متنباز قابل میزبانی محلی رقابت سنگینی به راه انداختهاند. از سوی دیگر، درخشش مدل چینی Qwen-Audio-3.1-TTS-Plus در تست صدای یکسان، نشان میدهد اگر قصد استفاده از یک صدای کلونشده ثابت را دارید، گزینههای فوقالعاده دیگری هم در دسترستان است.
جالب است بدانید بیش از ۵۵ درصد از درآمدهای ElevenLabs از مشتریان سازمانی تأمین میشود. درآمد تکرارشونده سالانه (ARR) این استارتاپ از حدود ۳۳۰ میلیون دلار به بیش از ۶۰۰ میلیون دلار جهش کرده و اخیراً توانسته در راند سرمایهگذاری تحت رهبری سکویا کپیتال، ۵۰۰ میلیون دلار با ارزشگذاری خیرهکننده ۱۱ میلیارد دلاری جذب کند.
چه مدلی برای چه کاری مناسب است؟
- روایت متن انگلیسی، کتاب صوتی و شخصیتپردازی: مدل Eleven v4 با کنترل عالی روی لحن و کیفیت استثنایی صداهای پیشفرض بهترین انتخاب است، هرچند قیمت پایه ۸۰ دلار برای هر میلیون کاراکتر دارد.
- ایجنتهای صوتی آنی و زنده: نسخه توربو (Turbo) به لطف تأخیر ۱۵۰ میلیثانیهای و پشتیبانی از استریمینگ، انتخابی ایدهآل برای مکالمات سریع و بدون معطلی است.
- صداهای کلونشده اختصاصی و ثابت: مدل Qwen-Audio-3.1-TTS-Plus عملکرد فوقالعادهای در صداهای کلونشده نشان داده و قطعاً ارزش بررسی دارد.
- پروژههای پرحجم با حساسیت شدید به هزینه: مدل Gemini 3.8 Flash TTS گوگل با هزینهای به مراتب کمتر از رقبا در دسترس است.
- صداپیشگی در زبانهای غیرانگلیسی: مدل Sonic 3.6 شرکت Cartesia همچنان در اکثر زبانها دست بالا را دارد.
- استفاده از سرورهای اختصاصی و محلی: سیستمهای متنباز مثل Breeze TTS 2 هزینه کاراکتری ندارند، اما دردسرهای نگهداری و زیرساخت سرور را به همراه میآورند.
در نهایت، برای رسیدن به بهترین نتیجه، هر تیمی باید سناریوها، متون و شناسههای اختصاصی خود را مستقیماً ارزیابی کند. مدل Eleven v4 در حال حاضر پادشاه دنیای صداهای انگلیسی به شمار میرود، اما فاکتورهایی مثل قیمت بالا، نیاز به شبیهسازی مجدد صداهای قبلی و دقت پایینتر در خواندن کاراکترهای متوالی، مواردی هستند که نباید هنگام مهاجرت به این نسخه نادیده گرفته شوند.
مطالب مرتبط و پیشنهادی

«تاماگوچی جاسوسی!»؛ طوفان تمسخر کاربران علیه گجت پوشیدنی جدید متا
معرفی گجت پوشیدنی «میوز چارم» توسط متا با موجی از تمسخر و نگرانیهای امنیتی روبهرو شده است. کاربران این دیوایس را «تاماگوچی جاسوسی» نامیدهاند و شکست تلخ گجتهایی مانند Humane AI Pin را به زاکربرگ یادآوری میکنند.

بزرگترین ترس مدیر ارشد کوپایلوت مایکروسافت از آینده: هوش مصنوعی نباید در انحصار چند غول فناوری بماند!
در حالی که این روزها بحث درباره خطرات آخرالزمانی هوش مصنوعی داغ است، مدیر ارشد کوپایلوت مایکروسافت نگران سناریوی کاملاً متفاوتی است: اینکه ثروت و ارزش این انقلاب فناوری فقط در جیب چند غول سیلیکونولی خلاصه شود. مایکروسافت با تمرکز بر توزیع فراگیر، قصد دارد هوش مصنوعی را به دست تمام مردم و کسبوکارها برساند.

مایکروسافت میانبر Copilot را از چت تیمز حذف میکند؛ با نسخه دستوپا شکسته خداحافظی کنید!
مایکروسافت قصد دارد میانبر Copilot را از بخش چت تیمز حذف کرده و دسترسی به این ابزار هوش مصنوعی را در یک اپلیکیشن اختصاصی تجمیع کند. هدف از این اقدام، جلوگیری از سردرگمی کاربران و پایان دادن به استفاده ناخواسته از نسخه محدود این دستیار هوشمند است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.