ارزشگذاری ۲۲ میلیارد دلاری ElevenLabs و آینده هوش مصنوعی صوتی؛ گفتوگو با مدیرعامل
استارتاپ ElevenLabs تنها چهار سال پس از آغاز به کار، با ثبت درآمد سالانه ۶۰۰ میلیون دلاری و ارزشگذاری تخمینی ۲۲ میلیارد دلاری، پیشتاز بازار هوش مصنوعی صوتی شده است. ماتی استانشفسکی، مدیرعامل این شرکت، در گفتوگویی اختصاصی از روند ادغام هوش هیجانی در مدلهای صوتی، لزوم اطلاعرسانی به کاربران درباره ایجنتهای هوش مصنوعی و چشمانداز تجاری آینده سخن میگوید.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ ElevenLabs تنها چهار سال پس از تاسیس، به نرخ درآمد تکرارشونده سالانه ۶۰۰ میلیون دلاری و ارزشگذاری ۲۲ میلیارد دلاری رسیده است.
- به گفته مدیرعامل ElevenLabs، کسبوکارها در حال حاضر موظفند استفاده از ایجنتهای هوش مصنوعی را به جای اپراتورهای انسانی به اطلاع مشتری برسانند.
- بیش از ۵۵ درصد از درآمدهای این استارتاپ از قراردادهای کلان سازمانی با مشتریانی نظیر Klarna، Cisco و دویچه تلهکام تامین میشود.
- هدف بنیادین شرکت، ترکیب هوش با هوش هیجانی و عبور از آزمون تورینگ برای سیستمهای هوش مصنوعی مکالمهای ظرف سالهای آینده است.
شرکت ElevenLabs در حال توسعه لایه صوتی هوش مصنوعی است؛ مدلهایی که متن را به گفتاری با کیفیت طبیعی و بسیار نزدیک به صدای انسان تبدیل میکنند. بیشتر کاربران بدون آنکه متوجه شوند، در زمان تماس با مراکز پشتیبانی و خدمات مشتریان با این فناوری تعامل دارند. برای نمونه، شرکت Klarna پشتیبانی خط اول تلفنی ۳۵ میلیون کاربر آمریکایی خود را با این زیرساخت انجام میدهد. شرکتهای بزرگی نظیر Deutsche Telekom، Cisco، Adobe و شمار فزایندهای از دولتها نیز از همین سرویس استفاده میکنند. علاوه بر این، ElevenLabs پلتفرم خود را در دسترس تولیدکنندگان محتوا قرار داده است تا از آن برای تولید کتابهای صوتی، دوبله و خلق موسیقی استفاده کنند.
این استارتاپ در این مسیر تنها نیست و به طور فزایندهای وارد رقابت با مشتریان خود میشود؛ از جمله پلتفرم هوش مصنوعی مکالمهای Decagon که ابزار صوتی خود را بر پایه ElevenLabs آموزش داد و حالا رقیب مستقیم آن محسوب میشود. با این حال، به نظر نمیرسد سرمایهگذاران این حوزه نگرانی چندانی داشته باشند. این مجموعه با دستیابی به درآمد سالانه تکرارشونده (ARR) معادل ۶۰۰ میلیون دلار، تنها چهار سال پس از تاسیس، از سوی سرمایهگذاران خود ۲۲ میلیارد دلار ارزشگذاری شده است.
در حاشیه کنفرانس کارآفرینی Nrth در تورنتو، ماتی استانشفسکی (Mati Staniszewski)، همبنیانگذار و مدیرعامل ElevenLabs، در گفتوگویی به بررسی محورهای کلیدی این حوزه پرداخت؛ از جمله اینکه آیا شرکتها باید به کاربران خود اطلاع دهند که در حال گفتوگو با هوش مصنوعی هستند یا خیر (موضوعی که او قویاً با آن موافق است) و اینکه وضعیت حاشیه سود ناخالص شرکت چگونه است. استانشفسکی ارائه هرگونه جزئیات دقیق درباره سود ناخالص را رد کرد، اما به صراحت توضیح داد که اگر کاهش حاشیه سود به معنای گسترش سهم بازار باشد، هیچ ابایی از آن ندارد.
در ادامه، مشروح این گفتوگو را با تلخیص و ویرایش جزئی میخوانید:
سال گذشته در مصاحبهای پیشبینی کرده بودید که مدلهای صوتی ظرف دو تا سه سال به ابزاری عمومی و عادی بدل خواهند شد. در حال حاضر صحت آن پیشبینی را چطور ارزیابی میکنید؟
هنوز کارهای فراوانی برای انجام دادن باقی مانده و تفاوت کیفیتی که میتوان تنها در سطح خود مدل به آن دست یافت، کماکان قابل توجه است. با نگاهی بلندمدت، احتمالاً در سه تا پنج سال آینده این تفاوتها کمتر و کمرنگتر خواهد شد. هدفی که ما اشتیاق زیادی برای دستیابی به آن داریم و میخواهیم نخستین شرکتی باشیم که محققش میکند، قبولی در آزمون تورینگ برای هوش مصنوعی مکالمهای است. برای چنین جهشی باید هوش را با هوش هیجانی درآمیخت؛ به این معنا که سیستم باید عواطف طرف مقابل را بفهمد و توانایی آرامتر صحبت کردن یا بالا بردن صدا را در لحظه داشته باشد؛ دستاوردی که تا به امروز عملی نشده است.
در حال حاضر چه سهمی از درآمد کسبوکار شما را مشتریان سازمانی بزرگ تشکیل میدهند؟
درآمد سالانه تکرارشونده ما اکنون به ۶۰۰ میلیون دلار رسیده است. بیش از ۵۵ درصد از این رقم به مشتریان سازمانی سنتی تعلق دارد و بخش عمدهای از ۴۵ درصد باقیمانده را شرکتهای کوچک و متوسط، توسعهدهندگان، معماران سیستم و تولیدکنندگان محتوا تشکیل میدهند.
مشابه سایر حوزههای هوش مصنوعی، رقابت شما با مشتریانتان نیز در حال افزایش است؛ برای مثال Decagon محصول صوتی خود را بر بستر شما آموزش داد و حالا پردازشها را از طریق مدلهای اختصاصی خود اجرا میکند.
مرزهای میان حوزهها بسیار مبهم شده است. در گذشته میان شرکتهای توسعهدهنده مدل، شرکتهای ارائهدهنده پلتفرم و شرکتهای متمرکز بر اپلیکیشن، مرزبندی کاملاً شفافی وجود داشت. اما امروزه این مرزها به شدت در هم تنیده شدهاند. به عنوان نمونه، شرکتی مثل Anthropic که در آغاز تنها توسعهدهنده مدل پایه بود، اکنون به یک پلتفرم کامل و ارائهدهنده مجموعهای از اپلیکیشنهای متنوع تبدیل شده است. باور دارم این مسیر همچنان پیش خواهد رفت.
کاربران شما در ElevenLabs میتوانند «لایه استدلال» را از میان مدلهای گوناگون انتخاب کنند. استقبال از مدلهای مرجع آزمایشگاههای پیشرو در برابر مدلهای با وزن باز (Open-weight) را چطور میبینید؟
این انتخاب یک معادله صفر و صدی نیست. در حوزه پشتیبانی مشتری، اگر تماس دریافتی صرفاً جنبه اطلاعرسانی داشته باشد و قرار نباشد اقدامی صورت گیرد، استفاده از مدلهای متنباز پرتعداد کاملاً پاسخگو است؛ زیرا پایگاه دانش شما کیفیت تجربه را تضمین میکند. اما در خدمات مالی که نیاز به احراز هویت، استعلام تراکنشهای حساس یا بازپرداخت وجه وجود دارد، کوچکترین خطایی پذیرفته نیست و در این بخش مدلهای پیشرو همچنان دست بالا را خواهند داشت.
برخی از مدلهای متنباز با وزن باز چینی هستند؛ از طرفی دولت آمریکا و دولتهای اروپایی مشتری شما هستند. این همکاریها با چه چالشهایی روبرو است؟
هر پروژه رویکرد متفاوتی میطلبد. صداها و مدلهایی که پیادهسازی میکنیم، کاملاً تابع نیاز هر پرونده است. برای نمونه، در همکاری با دولت لهستان یا برزیل، هر کدام الزامات ویژهای دارند که ممکن است شامل مدل وزن باز، مدل اختصاصی بسته یا مدلی فاینتیونشده توسط خودشان باشد. در لهستان پروژه مربوط به حوزه بهداشت است؛ جایی که ۱۸ درصد از بیماران پس از ثبت نوبت هرگز به مراکز درمانی مراجعه نمیکردند. راهحل ما استقرار ایجنتهایی بود که برای یادآوری نوبت با شهروندان تماس میگیرند. مدلها متناسب با دادههای بومی آنها بهینهسازی شد و ما فرآیند ادغام را با حفظ دقیق حاکمیت محلی دادهها اجرا کردیم.
آیا کسبوکارها موظفند به مخاطب اعلام کنند که طرف گفتوگو یک ایجنت هوش مصنوعی است و نه انسان؟
معتقدم در مقطع کنونی این اطلاعرسانی کاملاً ضروری است. عموم جامعه هنوز به این فضا خو نگرفتهاند و الگو نشان میدهد افراد تمایلی ندارند احساس فریبخوردگی داشته باشند. اما پنج سال بعد، زمانی که هر انسانی ایجنت اختصاصی خود را برای پیگیری امور دارد، تماسگیرنده انتظار روبهرو شدن با یک ایجنت را خواهد داشت و هنجار اجتماعی تغییر خواهد کرد. اکنون میتوان راهکارهای مناسبی پیاده کرد؛ مثلاً اگر پاسخگویی اپراتور انسانی ۳۰ دقیقه زمان میبرد، حق انتخاب را به کاربر سپرد. در اکثر سناریوها، افراد ارتباط با ایجنت را ترجیح میدهند و کیفیت تعامل نیز آنها را شگفتزده میکند.
با توجه به هزینههای سنگین مدلها و فرآیند استنتاج (Inference)، حاشیه سود ناخالص شرکت چه وضعیتی دارد؟
نمیتوانم رقم دقیقی ارائه دهم. با توجه به اتکا به تحقیقات درونسازمانی، توانستهایم مدلها را به روشهایی هوشمندانه فاینتیون و مدیریت کنیم. با این حال، هر جا امکان کاهش هزینه و انتقال این تخفیف به مشتری وجود داشته باشد، بیدرنگ این کار را انجام میدهیم. اولویت اصلی اثبات کارایی و جلب رضایت مشتری است؛ بنابراین اگر لازم باشد برای نمایش ارزش افزوده فناوری سرمایهگذاری کنیم، از کاهش حاشیه سود نگران نیستیم تا در افق پنجساله با ایجاد ارزش مشترک منتفع شویم.
شما به میلیونها ساعت فایل صوتی تماسهای پشتیبانی دسترسی دارید؛ آیا آموزش مدلها بر بستر این مکالمات انجام میشود و چه میزان از دادهها سنتتیک است؟
در همکاری با برخی سازمانها، مدلها را به شکل مشترک و منطبق بر نیازهای اختصاصی آنها توسعه دادیم. در سایر موارد، تمرکز فرآیند آموزش بیشتر روی برچسبگذاری و حاشیهنویسی عمیق دادهها بوده است تا صرفاً حجم بالای فایلها. هزاران نیروی متخصص به صورت قراردادی با ما همکاری دارند تا علاوه بر محتوای کلمات، زمانبندی مکالمه، نحوه بیان جملات و لایههای احساسی را حاشیهنویسی کنند. ما حتی مربیان حرفهای فن بیان را استخدام کردیم تا بتوانند لهجهها و لحنها را با نهایت دقت بازتولید کنند.
گزارشهایی مبنی بر هدفگذاری سال ۲۰۲۸ برای عرضه اولیه سهام (IPO) منتشر شده است؛ این موضوع را تایید میکنید؟
رویای ما پایهریزی شرکتی باثبات و ماندگار در گذر زمان است. در حال ایجاد زیرساختهای لازم هستیم تا طی سالهای آتی این اقدام را عملی کنیم، اما تحقق نهایی آن منوط به شرایط بازار در زمان مقتضی خواهد بود.
عنوان «سالهای آتی» عبارتی بسیار مبهم است.
[میخندد.]
دیدگاه شما درباره لزوم توقف یا کاهش سرعت توسعه در آزمایشگاههای پیشرو چیست؟
میان تمامی رهبران صنعت نوعی اتفاقنظر برای یافتن ریتم حرکتی مناسب وجود دارد. اینکه ابعاد این موضوع چقدر در رسانهها بازتاب یابد یا زیر چتر قانونگذاری برود، مبحثی جداگانه است. اما تردیدی نیست که باید احتیاطهای لازم را در زمان استقرار فناوری لحاظ کرد. البته ما بر توسعه مدلهای متنی یا بخش هوش عمومی که هسته اصلی این بحثها است تمرکز نداریم.
آیا ممکن است ElevenLabs با چالشهای امنیتی مشابه آسیبپذیریهای اخیر پلتفرم Hugging Face مواجه شود؟
ما در معماری خود یک گام جلوتر هستیم؛ زیرا ماژولهای خودتکثیرشونده یا حلقههای بازگشتی هوش ایجنتها را فعال نمیکنیم. فناوری ما به هیچ عنوان این امکان را به ایجنتها نمیدهد که ایجنتهای دیگری خلق کنند. علاوه بر این، تمامی مشتریان فرآیند اعتبارسنجی و احراز هویت (KYC) را طی میکنند. ریسکهای سایبری یک واقعیت انکارناپذیر در سراسر جهان است، اما ما لایههای امنیتی بازدارندهای تدوین کردهایم.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.