پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رکوردشکنی ElevenLabs با مدل جدید Eleven v4؛ پادشاه جدید هوش مصنوعی صوتی انگلیسی!

انتشار:۶ مهر ۱۴۰۵(۱ ساعت پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

شرکت ElevenLabs با معرفی مدل صوتی Eleven v4 و ثبت امتیاز کم‌نظیر ۹۱.۷ درصدی در دقت تلفظ، به صدر جدول هوش مصنوعی صوتی انگلیسی تکیه زد. این مدل قدرتمند با پشت سر گذاشتن رقبای نام‌آشنایی مثل جمینای گوگل، در دو نسخه پرچمدار و توربو برای روایت داستان، تولید محتوا و اجرای ایجنت‌های صوتی بی‌درنگ عرضه شده است.

رکوردشکنی ElevenLabs با مدل جدید Eleven v4؛ پادشاه جدید هوش مصنوعی صوتی انگلیسی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل صوتی جدید Eleven v4 با پشت سر گذاشتن رقبای نام‌داری مثل جمینای گوگل و کارتیزیا سونیک، به صدر جدول هوش مصنوعی تبدیل متن به گفتار انگلیسی رسید.
  • این مدل در بخش پایداری و صحت تلفظ کلمات سخت و عبارات تخصصی به امتیاز کم‌نظیر ۹۱.۷ درصدی دست یافته که رکوردی تازه در این صنعت محسوب می‌شود.
  • با وجود کیفیت خیره‌کننده، هزینه بالای ۸۰ دلاری به ازای هر میلیون کاراکتر و تسلط رقیبش (Sonic 3.6) در زبان‌های غیرانگلیسی، انتخاب میان گزینه‌ها را به نوع پروژه وابسته می‌کند.

صدرنشینی Eleven v4 در تبدیل متن به گفتار انگلیسی؛ کیفیت عالی اما گران‌قیمت

بر اساس تازه‌ترین رده‌بندی بنچمارک معتبر Provider Voice Arena در مجموعه Artificial Analysis، مدل Eleven v4 توانسته در صدر جدول برترین مدل‌های تبدیل متن به گفتار (TTS) زبان انگلیسی قرار بگیرد. این مدل جدید بالاتر از رقبای سرسختی چون Sonic 3.6 از شرکت Cartesia و همچنین Gemini 3.8 Flash TTS گوگل نشسته و بالاترین امتیاز ترکیبی پایداری و دقت تلفظ را در تاریخ این بنچمارک به نام خود ثبت کرده است.

شرکت ElevenLabs دو نسخه متفاوت از این مدل را برای کاربردهای گوناگون راهی بازار کرده است: نسخه پرچمدار v4 که مخصوص روایت داستان، صداپیشگی و اجرای نقش شخصیت‌هاست، و نسخه توربو (Turbo) که با تمرکز ویژه روی کاهش تأخیر، برای ایجنت‌های صوتی آنی و زنده توسعه یافته است. طبق گزارش تک‌کرانچ، هر دو نسخه امکان کنترل لحن و حس گوینده را ارتقا داده‌اند و حالا به جای حدود ۷۰ زبان در نسخه قبلی، از بیش از ۹۰ زبان مختلف پشتیبانی می‌کنند.

صداهای پیش‌فرض و اختصاصی؛ برگ برنده نسخه چهارم

بنچمارک Provider Voice Arena عملکرد هر مدل را با صداهای پیش‌فرض و تنظیمات کارخانه‌ای آن ارزیابی می‌کند. امتیاز Elo در واقع بازتاب‌دهنده انتخاب کاربران در مقایسه‌های رودررو است؛ یعنی هر چه امتیاز بالاتر باشد، نشان می‌دهد شنوندگان صدای آن مدل را طبیعی‌تر و دلنشین‌تر دانسته‌اند.

رتبه
مدل
امتیاز Elo
۱
Eleven v4
۱,۳۱۹
۲
Cartesia Sonic 3.6
۱,۲۷۶
۳
Gemini 3.8 Flash TTS
۱,۲۶۷

امتیاز درخشان Eleven v4 حاصل ارزیابی ۱,۶۷۴ نمونه صوتی مختلف است. جالب اینکه این مدل در هر چهار دسته‌بندی اصلی این ارزیابی، یعنی خدمات مشتریان، دستیارهای مجازی، انتقال دانش و بخش سرگرمی، رتبه نخست را از آن خود کرده است.

در مقابل، جدول دیگری به نام Controlled Voice وجود دارد که برای سنجش بی‌طرفانه، یک صدای کلون‌شده یکسان را روی همه سیستم‌ها پخش می‌کند تا برتری آرشیو صوتی خود شرکت‌ها نقشی در نتیجه نداشته باشد. در این بخش، Eleven v4 با امتیاز ۱,۱۵۷ در جایگاه دوم ایستاده و پشت سر مدل Qwen-Audio-3.1-TTS-Plus شرکت علی‌بابا (با امتیاز ۱,۱۷۸) قرار گرفته است. این موضوع نشان می‌دهد صداهای پیش‌فرض و بهینه‌سازی‌های اختصاصی ElevenLabs نقش پررنگی در صدرنشینی آن در جدول اصلی داشته‌اند.

باید در نظر داشت که امتیازهای Elo رتبه‌بندی‌های نسبی هستند نه درصد مطلق کیفیت، و با ثبت آرای بیشتر کاربران ممکن است تغییر کنند. بنابراین اختلاف ۲۱ امتیازی در جدول صدای کنترل‌شده، به این معناست که تیم‌ها باید خودشان کیفیت را تست عملی کنند و تنها به جدول اتکا نکنند.

رسیدن به دقت تلفظ ۹۱.۷ درصدی؛ خداحافظی با تپق‌های ماشینی

مدل‌های صوتی هوش مصنوعی معمولاً موقع خواندن مخفف‌ها، اصطلاحات پیچیده علمی، کلماتی که تلفظشان وابسته به لحن جمله است و رشته‌های طولانی از اعداد (مثل شماره سفارش) حسابی تپق می‌زنند. مجموعه Artificial Analysis برای سنجش همین موضوع، از شنوندگان انسانی کمک می‌گیرد تا فایل‌های صوتی تولیدشده را با تلفظ استاندارد مقایسه کنند.

دسته‌بندی ارزیابی
موضوع تست
نتیجه Eleven v4
وضعیت رقبا و نسخه‌های قبلی
باز کردن و ادای درست مخفف‌ها
خواندن دقیق و صحیح کلمات اختصاری
۹۴.۱٪
نسخه v3 امتیاز ۸۲.۷٪ گرفته بود
تلفظ مناسب بر اساس متن و لحن جمله
تشخیص درست تلفظ از بافت جمله
۹۴.۱٪
جمینای ۳.۸ فلش با ۹۷.۹٪ صدرنشین است
کلمات و اصطلاحات منفرد
خواندن اصطلاحات خاص بدون قرارگیری در جمله
۹۳.۲٪
نسخه مکالمه‌ای v3 با ۹۵.۱٪ صدرنشین است
حفظ دقیق دنباله حروف و اعداد
خواندن دقیق شناسه‌ها، کدها و رشته‌های عددی
۷۸.۸٪
نسخه v3 امتیاز ۷۱.۲٪ داشت؛ مدل SpaceXAI با ۸۵.۷٪ اول است

امتیاز کلی ۹۱.۷ درصدی، بالاترین رکوردی است که تاکنون برای یک مدل تبدیل متن به گفتار در این بنچمارک ثبت شده است. علاوه بر این، Eleven v4 تنها مدلی است که توانسته در سه بخش از چهار بخش، امتیازی بالای ۹۳ درصد به دست آورد.

با این حال، خواندن دقیق رشته‌های طولانی و کاراکترهای پی‌درپی با دقت ۷۸.۸ درصد، همچنان پاشنه آشیل این مدل به حساب می‌آید. بنابراین سرویس‌هایی که با کدهای رهگیری، اصطلاحات خاص دارویی و پزشکی، شناسه‌های حساب کاربری یا شماره سریال کالاها سر و کار دارند، حتماً قبل از استفاده در محیط عملیاتی باید تست‌های دقیقی انجام دهند و گزینه‌های جایگزین در نظر بگیرند.

افزایش چشمگیر سرعت همگام با قیمت نجومی

طبق بررسی‌ها، سرعت پردازش Eleven v4 به ۷۳.۴ کاراکتر در ثانیه رسیده که جهش بزرگی نسبت به سرعت ۴۲.۵ کاراکتری نسخه قبلی (v3) است. البته این عدد صرفاً سرعت خود موتور صوتی را نشان می‌دهد و شامل تأخیر شبکه اینترنت، زمان پاسخگویی مدل زبانی یا پخش فایل صوتی در سمت کاربر نمی‌شود.

مدل
قیمت هر یک میلیون کاراکتر
نسبت هزینه در مقایسه با v4
Eleven v4
۸۰ دلار
۱۰۰٪
Cartesia Sonic 3.6
۴۹ دلار
۶۱٪
Gemini 3.8 Flash TTS
۱۶.۴۹ دلار
۲۱٪

با قیمت‌های استاندارد فعلی، استفاده از Eleven v4 تقریباً ۱.۶ برابر گران‌تر از Sonic 3.6 و حدود ۴.۹ برابر گران‌تر از Gemini 3.8 Flash TTS آب می‌خورد. البته این تعرفه‌ها بسته به پلن‌های اشتراکی و حجم مصرف ممکن است دستخوش تخفیف شوند.

الون‌لبز برای دو هفته ابتدایی عرضه، تخفیف ویژه‌ای در نظر گرفته که قیمت v4 را به ۲۲ دلار و قیمت نسخه توربو را به ۱۱ دلار به ازای هر میلیون کاراکتر کاهش می‌دهد. همچنین کاربران واجد شرایط طرح Creator+ می‌توانند در سقف اعتبار ماهانه خود بدون پرداخت هزینه اضافی از v4 استفاده کنند؛ هرچند پس از اتمام دوره تبلیغاتی، همان نرخ پایه و سنگین ۸۰ دلار محاسبه خواهد شد.

تغییرات اساسی در کلون صدا و لزوم آموزش مجدد

شرکت ElevenLabs معماری بخش کلون و شبیه‌سازی صدا را در نسخه چهارم از نو بازنویسی کرده است. قابلیت «کلون آنی» حالا می‌تواند تنها با یک فایل ضبط‌شده ۱۰ ثانیه‌ای صدایی بسیار شبیه بسازد و گزینه «کلون حرفه‌ای» نیز که در نسخه v3 غایب بود، دوباره بازگشته است. این شرکت ادعا می‌کند کلون آنی v4 کیفیتی حتی بالاتر از کلون حرفه‌ای در نسخه چندزبانه قبلی (Multilingual v2) دارد، اگرچه این ادعا هنوز توسط تست‌های مستقل عمومی راستی‌آزمایی نشده است.

نکته مهم برای توسعه‌دهندگان این است که صداهای کلون‌شده قدیمی (چه آنی و چه حرفه‌ای) برای کارکرد بهینه روی این نسخه جدید، نیاز به آموزش مجدد (Retraining) دارند. البته برنامه‌هایی که از API این شرکت استفاده می‌کنند، خیلی راحت و صرفاً با تغییر شناسه مدل می‌توانند از نسخه جدید بهره ببرند:

const audio = await elevenlabs.textToSpeech.convert(
  's3TPKV1kjDlVtZbl4Ksh',
  {
    text: 'The first move is what sets everything in motion.',
    modelId: 'eleven_v4'
  }
);

با این حال، آپدیت کد به تنهایی کافی نیست و فرآیند آموزش مجدد صداها باید به صورت جداگانه انجام شود. به تیم‌های فنی توصیه می‌شود قبل از انتقال ترافیک اصلی کاربران، لحن، سرعت، ثبات و یکدستی صداهای جدید را با نسخه‌های قبلی مقایسه کنند.

از سوی دیگر، نسخه توربو زمان پاسخگویی فوق‌العاده‌ای دارد؛ میانه زمان تولید اولین بخش صدا (Time to First Speech) تنها ۱۵۰ میلی‌ثانیه اعلام شده و از استریم دوطرفه داده‌ها هم پشتیبانی می‌کند. البته باید توجه داشت که تأخیر نهایی ایجنت‌های صوتی، به عواملی مثل کیفیت شبکه، سرعت تولید متن توسط مدل هوش مصنوعی و بافر سیستم پخش کاربر نیز بستگی دارد.

برتری در انگلیسی؛ رقابت داغ در سایر زبان‌ها

صدرنشینی بی‌چون‌وچرای مدل جدید ElevenLabs در حال حاضر فقط مربوط به زبان انگلیسی است. مدل Sonic 3.6 متعلق به شرکت Cartesia همچنان در ۸ زبان از ۹ زبان غیرانگلیسی ارزیابی‌شده در صدر قرار دارد؛ هرچند که Eleven v4 مدعی پشتیبانی از بیش از ۹۰ زبان مختلف است.

علاوه بر این، شرکت‌های سرشناسی مانند Deepgram، Fish Audio، Boson، WellSaid Labs، گوگل و اوپن‌ای‌آی به همراه مدل‌های متن‌باز قابل میزبانی محلی رقابت سنگینی به راه انداخته‌اند. از سوی دیگر، درخشش مدل چینی Qwen-Audio-3.1-TTS-Plus در تست صدای یکسان، نشان می‌دهد اگر قصد استفاده از یک صدای کلون‌شده ثابت را دارید، گزینه‌های فوق‌العاده دیگری هم در دسترستان است.

جالب است بدانید بیش از ۵۵ درصد از درآمدهای ElevenLabs از مشتریان سازمانی تأمین می‌شود. درآمد تکرارشونده سالانه (ARR) این استارتاپ از حدود ۳۳۰ میلیون دلار به بیش از ۶۰۰ میلیون دلار جهش کرده و اخیراً توانسته در راند سرمایه‌گذاری تحت رهبری سکویا کپیتال، ۵۰۰ میلیون دلار با ارزش‌گذاری خیره‌کننده ۱۱ میلیارد دلاری جذب کند.

چه مدلی برای چه کاری مناسب است؟

  • روایت متن انگلیسی، کتاب صوتی و شخصیت‌پردازی: مدل Eleven v4 با کنترل عالی روی لحن و کیفیت استثنایی صداهای پیش‌فرض بهترین انتخاب است، هرچند قیمت پایه ۸۰ دلار برای هر میلیون کاراکتر دارد.
  • ایجنت‌های صوتی آنی و زنده: نسخه توربو (Turbo) به لطف تأخیر ۱۵۰ میلی‌ثانیه‌ای و پشتیبانی از استریمینگ، انتخابی ایده‌آل برای مکالمات سریع و بدون معطلی است.
  • صداهای کلون‌شده اختصاصی و ثابت: مدل Qwen-Audio-3.1-TTS-Plus عملکرد فوق‌العاده‌ای در صداهای کلون‌شده نشان داده و قطعاً ارزش بررسی دارد.
  • پروژه‌های پرحجم با حساسیت شدید به هزینه: مدل Gemini 3.8 Flash TTS گوگل با هزینه‌ای به مراتب کمتر از رقبا در دسترس است.
  • صداپیشگی در زبان‌های غیرانگلیسی: مدل Sonic 3.6 شرکت Cartesia همچنان در اکثر زبان‌ها دست بالا را دارد.
  • استفاده از سرورهای اختصاصی و محلی: سیستم‌های متن‌باز مثل Breeze TTS 2 هزینه کاراکتری ندارند، اما دردسرهای نگهداری و زیرساخت سرور را به همراه می‌آورند.

در نهایت، برای رسیدن به بهترین نتیجه، هر تیمی باید سناریوها، متون و شناسه‌های اختصاصی خود را مستقیماً ارزیابی کند. مدل Eleven v4 در حال حاضر پادشاه دنیای صداهای انگلیسی به شمار می‌رود، اما فاکتورهایی مثل قیمت بالا، نیاز به شبیه‌سازی مجدد صداهای قبلی و دقت پایین‌تر در خواندن کاراکترهای متوالی، مواردی هستند که نباید هنگام مهاجرت به این نسخه نادیده گرفته شوند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

«تاماگوچی جاسوسی!»؛ طوفان تمسخر کاربران علیه گجت پوشیدنی جدید متا
آخرین اخبار

«تاماگوچی جاسوسی!»؛ طوفان تمسخر کاربران علیه گجت پوشیدنی جدید متا

معرفی گجت پوشیدنی «میوز چارم» توسط متا با موجی از تمسخر و نگرانی‌های امنیتی روبه‌رو شده است. کاربران این دیوایس را «تاماگوچی جاسوسی» نامیده‌اند و شکست تلخ گجت‌هایی مانند Humane AI Pin را به زاکربرگ یادآوری می‌کنند.

۶ دقیقه مطالعه
۰
۶ مهر
بزرگ‌ترین ترس مدیر ارشد کوپایلوت مایکروسافت از آینده: هوش مصنوعی نباید در انحصار چند غول فناوری بماند!
آخرین اخبار

بزرگ‌ترین ترس مدیر ارشد کوپایلوت مایکروسافت از آینده: هوش مصنوعی نباید در انحصار چند غول فناوری بماند!

در حالی که این روزها بحث درباره خطرات آخرالزمانی هوش مصنوعی داغ است، مدیر ارشد کوپایلوت مایکروسافت نگران سناریوی کاملاً متفاوتی است: این‌که ثروت و ارزش این انقلاب فناوری فقط در جیب چند غول سیلیکون‌ولی خلاصه شود. مایکروسافت با تمرکز بر توزیع فراگیر، قصد دارد هوش مصنوعی را به دست تمام مردم و کسب‌وکارها برساند.

۳ دقیقه مطالعه
۰
۶ مهر
مایکروسافت میانبر Copilot را از چت تیمز حذف می‌کند؛ با نسخه دست‌و‌پا شکسته خداحافظی کنید!
آخرین اخبار

مایکروسافت میانبر Copilot را از چت تیمز حذف می‌کند؛ با نسخه دست‌و‌پا شکسته خداحافظی کنید!

مایکروسافت قصد دارد میانبر Copilot را از بخش چت تیمز حذف کرده و دسترسی به این ابزار هوش مصنوعی را در یک اپلیکیشن اختصاصی تجمیع کند. هدف از این اقدام، جلوگیری از سردرگمی کاربران و پایان دادن به استفاده ناخواسته از نسخه محدود این دستیار هوشمند است.

۴ دقیقه مطالعه
۰
۶ مهر