پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

تجربه تعامل با آواتارهای تعاملی هوش مصنوعی Synthesia؛ آغاز عصر همزادهای دیجیتال

انتشار:۴ مهر ۱۴۰۵(۲ روز پیش)
۷ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Synthesia با توسعه آواتارهای تعاملی مبتنی بر هوش مصنوعی، امکان گفتگوی دوطرفه با همزادهای دیجیتال را فراهم کرده است؛ پیشرفتی که افزون‌بر کاربردهای تجاری و آموزشی، پرسش‌های بنیادینی پیرامون آینده خبرنگاری و اعتماد مخاطبان پدید آورده است.

تجربه تعامل با آواتارهای تعاملی هوش مصنوعی Synthesia؛ آغاز عصر همزادهای دیجیتال

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ Synthesia به ارزش ۴ میلیارد دلار، امکان ساخت آواتارهای تعاملی مجهز به مدل‌های زبانی ایجنتی و پردازش بلادرنگ گفتار را فراهم کرده است.
  • آواتارهای تعاملی بر پایه متون و اسناد اختصاصی آموزش می‌بینند و به‌صورت تعیین‌گرایانه (Deterministic) تنها به موضوع مشخص‌شده پاسخ می‌دهند.
  • ساختار فنی این سیستم ترکیبی از مدل‌های تبدیل گفتار به متن، مدل زبانی ایجنتی، تبدیل متن به صدا و انیمیشن‌سازی تصویر است.
  • ورود همزادهای دیجیتال به حوزه رسانه چالش‌های اخلاقی و حرفه‌ای، به‌ویژه در زمینه حفظ اعتماد عمومی و پیشگیری از محتوای بی‌کیفیت (AI slop) ایجاد می‌کند.

در تابستان سال جاری، زمانی که الکساندرو وویکا (Alexandru Voica)، مدیر روابط عمومی استارتاپ تولید ویدیو Synthesia، پیوندی به جدیدترین عضو تیم روابط عمومی خود به نمایش گذاشت، شگفتی ناظران رسانه‌ای را برانگیخت. این عضو جدید در واقع یک آواتار مجازی تعاملی از خود وویکا بود که آموزش دیده بود تا به پرسش‌های رایج خبرنگاران پیرامون عملکرد و سرویس‌های Synthesia پاسخ دهد. در شرایطی که استفاده از هوش مصنوعی برای تولید بیانیه‌ها و پیش‌نویس‌های متنی در روابط عمومی به موضوعی بحث‌برانگیز تبدیل شده، حضور یک آواتار زنده تعاملی نقطه‌عطفی جدی در این صنعت به شمار می‌رود.

استارتاپ Synthesia که ابتدا در بریتانیا پایه‌گذاری شد و اکنون دفتر جدیدی در نیویورک دایر کرده، در کنار پلتفرم‌هایی مانند D-ID، HeyGen و Colossyan از بازیگران اصلی حوزه آواتارهای دیجیتال به شمار می‌آید. این شرکت اوایل سال جاری میلادی به ارزش‌گذاری ۴ میلیارد دلاری دست یافت و سال گذشته نیز درآمد سالانه تکرارشونده (ARR) آن از مرز ۱۰۰ میلیون دلار عبور کرد.

سرویس‌های Synthesia به سازمان‌ها و شرکت‌ها اجازه می‌دهد ویدیوهای آموزشی تعاملی با حضور آواتارهای هوش مصنوعی تولید کنند. این استارتاپ اخیراً قابلیتی موسوم به «Roleplay Sessions» را معرفی کرده است که به کارمندان امکان می‌دهد برای نمونه، مهارت‌های ارائه و فروش را با یک آواتار هوش مصنوعی تعاملی تمرین کنند؛ آواتاری که به شکل بلادرنگ پاسخ می‌دهد و به بازدهی کارمندان امتیاز اختصاص می‌دهد.

در جریان افتتاح دفتر جدید این شرکت در نیویورک، امکانی فراهم شد تا نسخه دوقلوی دیجیتال اختصاصی برای خبرنگاران نیز شبیه‌سازی شود؛ فرصتی که تجربه دست‌اول تعامل با همزاد مجازی را در اختیار اصحاب رسانه قرار می‌دهد.

پیش از ورود به مرحله آزمایش مستقیم، بسیاری از کارشناسان نسبت به کاربرد گسترده آواتارها مردد بودند؛ هرچند پیش‌بینی می‌شد که این فناوری به‌تدریج به بخشی اجتناب‌ناپذیر از زندگی آنلاین تبدیل شود. در شبکه‌های اجتماعی نظیر اینستاگرام نیز استفاده از همزادهای دیجیتال برای تولید محتوا رو به گسترش است. تولید این نمونه آزمایشی نخستین باری است که Synthesia برای شخصی خارج از حلقه مدیران خود یک آواتار دوطرفه می‌سازد. این همزاد دیجیتال بر اساس مقاله‌ای تحقیقی پیرامون وقوع کلاهبرداری در استارتاپ‌های جذب سرمایه‌کرده آموزش دیده و تنها قادر به پاسخگویی به پرسش‌های مربوط به همان گزارش است. 

برای شروع تعامل، کافی است گزینه «start in a new window» انتخاب شود.

کاربران می‌توانند پرسش‌هایی از قبیل موارد زیر را از این همزاد هوشمند بپرسند:

  • چرا این گزارش به رشته تحریر درآمد؟
  • این مقاله پژوهشی درباره چیست؟
  • پژوهشگران به چه یافته‌هایی دست یافته‌اند؟

فرایند ساخت این همزاد در یک استودیوی اختصاصی کوچک در دفتر شرکت Synthesia انجام می‌گیرد؛ جایی که تصاویر متعددی از زوایای مختلف به همراه دو دقیقه ضبط صدای طبیعی ثبت می‌شود. پس از کسب رضایت رسمی، دو نوع آواتار ایجاد می‌شود: آواتار شخصی (Personal Avatar) که متن‌های ورودی را با چهره (همراه با عینک و بدون عینک) بازخوانی می‌کند، و دو آواتار تعاملی (Interactive Avatar) که توانایی شنیدن، تحلیل و مکالمه دوجانبه با کاربر را دارند. 

برای راه‌اندازی نسخه تعاملی، محتوای یک مقاله انتخاب شد تا مدل بر پایه آن آموزش ببیند. این آواتار مبتنی بر ترکیبی هم‌افزا از مدل‌های تبدیل گفتار به متن (Voice-to-Text)، بینایی و ویدیو، مدل زبانی، و تبدیل متن به گفتار (Text-to-Voice) فعالیت می‌کند. ساختار فنی این سیستم از مدل‌های صوتی و تصویری اختصاصی Synthesia بهره می‌برد؛ هرچند این شرکت به مشتریان اجازه می‌دهد از مدل‌های آزمایشگاه‌های دیگری چون Cartesia، ElevenLabs، Google یا OpenAI نیز استفاده کنند. شرکت‌ها همچنین می‌توانند آواتارها را روی سرورهای ابری اختصاصی خود میزبانی کنند یا هزینه میزبانی را به Synthesia بپردازند.

در چرخه پردازش، مدل تبدیل گفتار به متن سخنان کاربر را استخراج می‌کند؛ سپس یک مدل زبانی مبتنی بر ایجنت مفهوم متن را درک کرده و کنش‌های لازم را تعیین می‌کند. در مرحله بعد مدل تبدیل متن به صوت، پاسخ نهایی را به صدا تبدیل کرده و در نهایت مدل ویدیویی Synthesia حرکت لب، حالات چهره و انیمیشن آواتار را با گفتار همگام می‌سازد. 

به‌طور کلی، محصولات استارتاپ Synthesia به سه بخش اصلی تقسیم می‌شود: یک پلتفرم تولید و انتشار ویدیو با آواتارهای سنتی که متن را می‌خوانند؛ پلتفرم تعاملی Sessions مبتنی بر ایجنت که برای نظرسنجی و تمرین نقش‌ها کاربرد دارد؛ و پلتفرم رابط برنامه‌نویسی کاربردی (API) که امکان ادغام مدل‌های صوت و تصویر شرکت را با سایر سرویس‌های ابری فراهم می‌آورد.

آماده‌سازی این آواتارها چند روز به طول انجامید. در آزمون نسخه شخصی، متنی ساده درباره فرارسیدن فصل پاییز در نیویورک برای آن در نظر گرفته شد. خروجی صدا دقت بالایی داشت و حتی گرفتگی اندک صدا در نمونه ضبط‌شده اولیه نیز در مدل نهایی برطرف شده بود. 

بررسی این ابزار توسط افراد غیرمتخصص نشان داد که این دستاورد در عین جذابیت، احساسی ناخوشایند و تا حدی عجیب (مشابه اثر دره وهمی) ایجاد می‌کند.

در ادامه، نسخه تعاملی مورد ارزیابی قرار گرفت؛ سیستمی تعیین‌گرایانه (Deterministic) که تنها در چارچوب متن آموزشی خود پاسخ می‌دهد. هنگام طرح پرسش‌هایی درباره سوابق کاری و محل سکونت، سیستم بدون انحراف، بحث را مجدداً به موضوع اصلی مقاله بازگرداند.

اگرچه شباهت ظاهری و لحن صدای نسخه تعاملی به اندازه آواتار شخصی دقیق نبود، اما میزان نزدیکی آن به واقعیت توجه خانواده و نزدیکان را جلب کرد. جالب آنکه اعضای خانواده پس از تلاش برای پرسیدن سوالات کاملاً خصوصی و دیدن مقاومت مدل، با شگفتی روبرو شدند و مادر آزمایش‌کننده به شوخی اعلام کرد: «به یاد نمی‌آورم دوقلو به دنیا آورده باشم!»

این تجربه پرسش‌های مهمی را درباره آینده حرفه روزنامه‌نگاری پدید می‌آورد. آیا مخاطبان پذیرای دریافت اخبار روزانه از زبان یک آواتار هوش مصنوعی خواهند بود؟ برخی سرمایه‌گذاران به‌طور قاطع این ایده را رد می‌کنند، به‌ویژه در برهه‌ای که انتقادها از ورود محتوای بی‌کیفیت و ساختگی (AI slop) به شبکه‌های اجتماعی شدت گرفته است. با این حال، هنوز مشخص نیست که آیا آواتارها جایگزین خبرنگاران خواهند شد یا صرفاً نقش ابزار کمکی را ایفا خواهند کرد، و آیا مدیران ارشد حاضر به مصاحبه با همزاد دیجیتال یک خبرنگار خواهند بود یا خیر. 

جوهره اصلی فعالیت خبرنگاری، ایجاد ارتباط انسانی، پژوهش میدانی و فراتر از همه، جلب اعتماد است؛ مؤلفه‌ای حیاتی که بعید به نظر می‌رسد بتوان آن را به هوش مصنوعی واگذار کرد.

با وجود این، در خارج از فضای رسانه، ایده شبیه‌سازی دیجیتال می‌تواند کارایی بالایی داشته باشد. پاسخگویی به مراجعات و پیام‌های کاری در دوران تعطیلات و سفر، از جمله مواردی است که یک همزاد مجازی به‌خوبی از عهده آن برمی‌آید.

نحوه به‌کارگیری این فناوری در ساختار شرکت‌های بزرگ همچنان در حال تکامل است. اما پس از محو شدن جذابیت اولیه، تماشای سکوت آواتار در انتظار پرسش بعدی، حسی غریب به همراه دارد؛ گویی کاربر منتظر پلک زدن، لبخند یا نشانه‌ای است که ثابت کند مدل آنچه را می‌گوید واقعاً می‌فهمد. 

مدل‌های تعیین‌گرایانه به دلیل طراحی کنترل‌شده هرگز چنین حسی را شبیه‌سازی نمی‌کنند. اما پیوند دادن این کالبد با چت‌بات‌های غیرتعیین‌گرایانه و مدل‌های زبانی آزاد، می‌تواند زمینه‌ساز توهمات و وابستگی‌های روانی به هوش مصنوعی شود.

پیش‌بینی‌ها نشان می‌دهد که نسل جدید کاربران (Gen Z) احتمالاً نگاهی محتاطانه و شبیه به فیلم‌های علمی‌تخیلی به دوقلوهای دیجیتال خواهند داشت. با این حال، آواتارهای دیجیتال در مقایسه با ربات‌های انسان‌نما دلهره کمتری ایجاد می‌کنند؛ چراکه در صورت بروز هرگونه رفتار ناهنجار، با بستن پنجره مرورگر می‌توان تعامل با آن‌ها را متوقف ساخت. 

تا تکامل نهایی این بسترها، بهره‌گیری از همزادهای دیجیتال برای ارائه خلاصه مهم‌ترین گزارش‌های خبری، تصویری واقع‌بینانه از آینده پیوند رسانه و هوش مصنوعی ترسیم می‌کند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر