پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدیران ارشد دنیای فناوری: هوش مصنوعی صوتی هنوز به «لحظه شگفت‌انگیز ChatGPT» نرسیده است!

انتشار:۱۹ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه
اشتراک و پسندیدن

با وجود سرمایه‌گذاری‌های میلیاردی روی هوش مصنوعی صوتی و معرفی مدل‌های مکالمه دوطرفه، مدیران ارشد شرکت‌های PolyAI و Otter معتقدند این فناوری هنوز به نقطه عطف و «لحظه ChatGPT» خود نرسیده است. به باور آن‌ها، کندی استدلال در لحظه، خطاهای بازشناسی گفتار و نبود حس انسانی واقعی همچنان موانع اصلی اعتماد کاربران به دستیارهای صوتی به شمار می‌روند.

مدیران ارشد دنیای فناوری: هوش مصنوعی صوتی هنوز به «لحظه شگفت‌انگیز ChatGPT» نرسیده است!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • با وجود سرازیر شدن میلیاردها دلار سرمایه به استارتاپ‌های هوش مصنوعی صوتی، مدیران برجسته این حوزه معتقدند مکالمات صوتی هوش مصنوعی در دنیای واقعی هنوز تا صحبت طبیعی مثل یک انسان فاصله زیادی دارد.
  • شان ون (CTO شرکت PolyAI) می‌گوید تولید مدل‌های دوطرفه هم‌زمان گام بزرگی بوده، اما چالش اصلی بعدی سرعت استدلال است تا مدل‌ها بتوانند در کسری از ثانیه پاسخ دهند و گفت‌وگو طبیعی حس شود.
  • الکس گی (مدیر ارشد بازاریابی Otter) معتقد است اشتباهات سیستم‌های تشخیص گفتار (ASR) باعث خطای زنجیره‌ای ایجنت‌ها می‌شود و تا احساسات انسانی بازآفرینی نشود، این ابزار‌ها چیزی فراتر از یک چت‌بات ساده نخواهند بود.

این ایده که «صدا» رابط کاربری بزرگ بعدی در دنیای فناوری خواهد بود، این روز‌ها حسابی سر زبان‌ها افتاده است؛ تا جایی که سرمایه‌گذاران میلیاردها دلار سرمایه را به پای استارتاپ‌های هوش مصنوعی صوتی ریخته‌اند. این استارتاپ‌ها روی حوزه‌های گوناگونی فعالیت می‌کنند؛ از سازندگان مدل‌های پایه صوتی گرفته تا ارائه‌دهندگان خدمات پشتیبانی مشتریان سازمانی، و از ابزار‌های یادداشت‌برداری هوشمند جلسات تا سرویس‌های تایپ صوتی مبتنی بر هوش مصنوعی.

هر هفته شاهد معرفی ابزار یا مدل جدیدی هستیم که ادعا می‌کند صدایش مو نمی‌زند با انسان و درست شبیه یک آدم واقعی گفت‌وگو می‌کند؛ اما واقعیت ماجرا ممکن است کاملاً متفاوت باشد. شان ون (Shawn Wen)، مدیر ارشد فناوری پلتفرم صوتی سازمانی PolyAI، معتقد است علی‌رغم عرضه مدل‌های تمام‌دوطرفه هم‌زمان (Full-Duplex) — یعنی مدل‌هایی که می‌توانند حین گوش دادن به شما هم‌زمان صحبت کنند — هوش مصنوعی صوتی هنوز به «لحظه ChatGPT» خودش نرسیده است.

او در جریان گفت‌وگو روی صحنه در کنفرانس HumanX توضیح داد: «ما به نقطه عطف توسعه مدل‌های تمام‌دوطرفه دست پیدا کرده‌ایم. حالا چالش بزرگ بعدی، بسیار سریع‌تر کردن فرآیند استدلال است؛ به طوری که مدل‌ها بتوانند پاسخ‌ها را در کسری از ثانیه پیدا کنند و مکالمه کاملاً روان و طبیعی به نظر برسد.»

ون همچنین تأکید کرد که ایجنت‌های هوش مصنوعی در بخش خدمات مشتریان نباید لحنی خشک و ربات‌گونه داشته باشند، بلکه باید حس اطمینان و اعتمادی در مخاطب ایجاد کنند که مطمئن شود این سیستم واقعاً توانایی حل مشکلش را دارد.

او در ادامه افزود: «فکر می‌کنم مرحله بعدی کمی متفاوت خواهد بود؛ زیرا به محض این‌که کیفیت صدا به حد کافی خوب شود و مشتری در دو سه نوبت اول تمایل به صحبت و تعامل پیدا کند، اعتماد او جلب می‌شود. با گذشت زمان، کاربر احساس خواهد کرد که اگر ایجنت هوش مصنوعی کارش را راه می‌اندازد، دیگر نیازی به صحبت با یک اپراتور انسانی نخواهد داشت.»

الکس گی (Alex Gay)، مدیر ارشد بازاریابی ابزار یادداشت‌برداری جلسات Otter، دیدگاه خود را این‌طور مطرح کرد که تشخیص گوینده، درک قصد و نیت کاربر و پیوند دادن آن با دانش سازمانی، گامی حیاتی برای خودکارسازی فرآیندها به شمار می‌رود. شرکت Otter همچنین در حال توسعه «دوقلوهای دیجیتال» (Digital Twins) است تا شاید در آینده بتوانند به عنوان نماینده افراد در جلسات شرکت کنند. او معتقد است برای چنین فناوری حساسی، فوق‌العاده حیاتی است که صدای خروجی دقیقاً همان بار احساسی و لحن زنده‌ای را منتقل کند که در گفت‌وگوی واقعی میان انسان‌ها در یک جلسه شکل می‌گیرد.

گی در این‌باره خاطرنشان کرد: «اگر به جلساتی که همین الان در آن‌ها شرکت می‌کنید فکر کنید، بهترین گفت‌وگوها آن‌هایی هستند که در آن بحث و تبادل نظر شکل می‌گیرد، تصمیم‌گیری‌های استراتژیک انجام می‌شود و حس می‌کنید یک ارتباط انسانی عمیق پشت صحبت‌ها وجود دارد. اگر نتوانید چنین تجربه‌ای را با یک آواتار داشته باشید، این ابزار صرفاً در حد یک چت‌بات پرسش و پاسخ معمولی باقی می‌ماند.»

چالش‌های درک زبان و شفافیت در هوش مصنوعی صوتی

با این‌که مدل‌های هوش مصنوعی صوتی پیشرفت چشمگیری داشته‌اند، دستیارهای هوشمند هنوز هم در بسیاری از مواقع منظور کاربر را متوجه نمی‌شوند، یا ابزار یادداشت‌برداری جلسه متن پیاده‌شده و خلاصه‌ای کاملاً اشتباه تحویل می‌دهد.

به عقیده شان ون، مدل‌های تشخیص خودکار گفتار (ASR) معمولاً کلمات کلیدی مهم را از دست می‌دهند و همین موضوع باعث می‌شود درک کل بستر و سیاق گفت‌وگو با اختلال مواجه شود.

الکس گی از شرکت Otter نیز این نکته را تأیید کرده و یادآور شد که این شرکت به‌طور مداوم روی ارتقای کیفیت رونویسی صوتی کار می‌کند. او همچنین زبان را یکی از حوزه‌هایی دانست که مدل‌های صوتی هنوز به پیشرفت چشمگیری در آن نیاز دارند.

او گفت: «برای Otter، رونویسی متن هیچ‌وقت مقصد نهایی نبوده است؛ بلکه صرفاً لایه اولیه‌ای بود که می‌توانستیم به کمک آن بهره‌وری را افزایش دهیم. اما اگر متن رونویسی اولیه دقت لازم را نداشته باشد، تمام اقدامات بعدی شما دچار ایراد و خطا می‌شود. از لحظه‌ای که سیستم دست به اقدام اشتباه بزند، کاربر اعتمادش را به کل پلتفرم از دست می‌دهد؛ بنابراین بهبود مداوم مدل‌های ASR برای ما حیاتی است، چرا که تبعات و تأثیرات اشتباهات آن روی تمامی مراحل بعدی زنجیره بسیار سنگین خواهد بود.»

در کنار مسائل فنی، ابزار‌های صوتی جدید با چالش مهم «شفافیت» هم روبه‌رو هستند. این ابزار‌ها باید به مشتریان اعلام کنند که صدایشان در حال ضبط است یا دارند با یک هوش مصنوعی صحبت می‌کنند. مسئولان Otter می‌گویند قصد دارند حس اعتماد را در افراد حاضر در جلسه تقویت کنند؛ بنابراین حتی در جلساتی که بات مستقیماً حضور ندارد، می‌خواهند راهکارهایی مثل ارسال پیام هشدار در چت برای اعلام ضبط شدن جلسه را پیاده‌سازی کنند. شان ون از PolyAI نیز تأکید کرد که در تماس‌های سازمانی، بسیار مهم است که مخاطبان بدانند در حال صحبت با یک سیستم هوش مصنوعی هستند.

بازخورد و اشتراک‌گذاری این مطلب

اگر این گزارش برایتان مفید بود، با پسندیدن و اشتراک‌گذاری آن با دیگران، از محتوای تخصصی هوش مصنوعی حمایت کنید.

اشتراک‌گذاری در شبکه‌های اجتماعی:

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

اجرای هوش مصنوعی ویدیویی Wan 2.1 علی‌بابا روی کارت‌های ۶ گیگابایتی با لانچر متن‌باز WanGP
آخرین اخبار

اجرای هوش مصنوعی ویدیویی Wan 2.1 علی‌بابا روی کارت‌های ۶ گیگابایتی با لانچر متن‌باز WanGP

استارتاپ‌ها و کاربران خانگی همیشه با مشکل حافظه کم کارت گرافیک برای اجرای مدل‌های ویدیویی سنگین دست‌وپنجه نرم می‌کنند. حالا ابزار متن‌باز WanGP با بهینه‌سازی هوشمند و جابه‌جایی بار پردازشی میان VRAM و رم سیستم، امکان اجرای مدل ویدیویی پرطرفدار Wan 2.1 علی‌بابا را حتی روی کارت‌های گرافیک ۶ و ۸ گیگابایتی فراهم کرده است.

۲ دقیقه مطالعه
۰
۱۹ مهر
شگفتی مدل ۳۰ مگابایتی Antalia-2 Mini: شکست غول‌های چند میلیاردی در تبدیل متن به گفتار ترکی!
آخرین اخبار

شگفتی مدل ۳۰ مگابایتی Antalia-2 Mini: شکست غول‌های چند میلیاردی در تبدیل متن به گفتار ترکی!

تیم هوش مصنوعی PatientDesk با معرفی مدل Antalia-2 Mini نشان داد که برای دستیابی به خروجی صوتی باکیفیت همیشه نیازی به مدل‌های سنگین نیست؛ این مدل متن‌باز ترکی با حجم باورنکردنی ۳۰ مگابایت حتی روی پردازنده‌های معمولی (CPU) اجرا می‌شود. نتایج بررسی‌ها نشان می‌دهد که این مدل فوق‌العاده سبک با کنار زدن مدل‌های چند میلیارد پارامتری، دقت شگفت‌انگیزی را در تبدیل متن به گفتار به نمایش گذاشته است.

۲ دقیقه مطالعه
۰
۱۹ مهر
به پاسخ‌های هوش مصنوعی گوگل اعتمادی نیست؟ با این ۶ ترفند کاربردی مهارش کنید!
آخرین اخبار

به پاسخ‌های هوش مصنوعی گوگل اعتمادی نیست؟ با این ۶ ترفند کاربردی مهارش کنید!

بخش خلاصه هوش مصنوعی گوگل (AI Overviews) چه بخواهیم و چه نخواهیم آمده است که بماند. اما به‌جای کنار گذاشتن آن یا کلافه شدن از خطاهایش، با یادگیری چند ترفند ساده پرامپت‌نویسی می‌توانید این ابزار را مهار کرده و دقیق‌ترین اطلاعات را از دل جست‌وجو بیرون بکشید.

۷ دقیقه مطالعه
۰
۱۹ مهر