تجربه تعامل با آواتارهای تعاملی هوش مصنوعی Synthesia؛ آغاز عصر همزادهای دیجیتال
استارتاپ Synthesia با توسعه آواتارهای تعاملی مبتنی بر هوش مصنوعی، امکان گفتگوی دوطرفه با همزادهای دیجیتال را فراهم کرده است؛ پیشرفتی که افزونبر کاربردهای تجاری و آموزشی، پرسشهای بنیادینی پیرامون آینده خبرنگاری و اعتماد مخاطبان پدید آورده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ Synthesia به ارزش ۴ میلیارد دلار، امکان ساخت آواتارهای تعاملی مجهز به مدلهای زبانی ایجنتی و پردازش بلادرنگ گفتار را فراهم کرده است.
- آواتارهای تعاملی بر پایه متون و اسناد اختصاصی آموزش میبینند و بهصورت تعیینگرایانه (Deterministic) تنها به موضوع مشخصشده پاسخ میدهند.
- ساختار فنی این سیستم ترکیبی از مدلهای تبدیل گفتار به متن، مدل زبانی ایجنتی، تبدیل متن به صدا و انیمیشنسازی تصویر است.
- ورود همزادهای دیجیتال به حوزه رسانه چالشهای اخلاقی و حرفهای، بهویژه در زمینه حفظ اعتماد عمومی و پیشگیری از محتوای بیکیفیت (AI slop) ایجاد میکند.
در تابستان سال جاری، زمانی که الکساندرو وویکا (Alexandru Voica)، مدیر روابط عمومی استارتاپ تولید ویدیو Synthesia، پیوندی به جدیدترین عضو تیم روابط عمومی خود به نمایش گذاشت، شگفتی ناظران رسانهای را برانگیخت. این عضو جدید در واقع یک آواتار مجازی تعاملی از خود وویکا بود که آموزش دیده بود تا به پرسشهای رایج خبرنگاران پیرامون عملکرد و سرویسهای Synthesia پاسخ دهد. در شرایطی که استفاده از هوش مصنوعی برای تولید بیانیهها و پیشنویسهای متنی در روابط عمومی به موضوعی بحثبرانگیز تبدیل شده، حضور یک آواتار زنده تعاملی نقطهعطفی جدی در این صنعت به شمار میرود.
استارتاپ Synthesia که ابتدا در بریتانیا پایهگذاری شد و اکنون دفتر جدیدی در نیویورک دایر کرده، در کنار پلتفرمهایی مانند D-ID، HeyGen و Colossyan از بازیگران اصلی حوزه آواتارهای دیجیتال به شمار میآید. این شرکت اوایل سال جاری میلادی به ارزشگذاری ۴ میلیارد دلاری دست یافت و سال گذشته نیز درآمد سالانه تکرارشونده (ARR) آن از مرز ۱۰۰ میلیون دلار عبور کرد.
سرویسهای Synthesia به سازمانها و شرکتها اجازه میدهد ویدیوهای آموزشی تعاملی با حضور آواتارهای هوش مصنوعی تولید کنند. این استارتاپ اخیراً قابلیتی موسوم به «Roleplay Sessions» را معرفی کرده است که به کارمندان امکان میدهد برای نمونه، مهارتهای ارائه و فروش را با یک آواتار هوش مصنوعی تعاملی تمرین کنند؛ آواتاری که به شکل بلادرنگ پاسخ میدهد و به بازدهی کارمندان امتیاز اختصاص میدهد.
در جریان افتتاح دفتر جدید این شرکت در نیویورک، امکانی فراهم شد تا نسخه دوقلوی دیجیتال اختصاصی برای خبرنگاران نیز شبیهسازی شود؛ فرصتی که تجربه دستاول تعامل با همزاد مجازی را در اختیار اصحاب رسانه قرار میدهد.
پیش از ورود به مرحله آزمایش مستقیم، بسیاری از کارشناسان نسبت به کاربرد گسترده آواتارها مردد بودند؛ هرچند پیشبینی میشد که این فناوری بهتدریج به بخشی اجتنابناپذیر از زندگی آنلاین تبدیل شود. در شبکههای اجتماعی نظیر اینستاگرام نیز استفاده از همزادهای دیجیتال برای تولید محتوا رو به گسترش است. تولید این نمونه آزمایشی نخستین باری است که Synthesia برای شخصی خارج از حلقه مدیران خود یک آواتار دوطرفه میسازد. این همزاد دیجیتال بر اساس مقالهای تحقیقی پیرامون وقوع کلاهبرداری در استارتاپهای جذب سرمایهکرده آموزش دیده و تنها قادر به پاسخگویی به پرسشهای مربوط به همان گزارش است.
برای شروع تعامل، کافی است گزینه «start in a new window» انتخاب شود.
کاربران میتوانند پرسشهایی از قبیل موارد زیر را از این همزاد هوشمند بپرسند:
- چرا این گزارش به رشته تحریر درآمد؟
- این مقاله پژوهشی درباره چیست؟
- پژوهشگران به چه یافتههایی دست یافتهاند؟
فرایند ساخت این همزاد در یک استودیوی اختصاصی کوچک در دفتر شرکت Synthesia انجام میگیرد؛ جایی که تصاویر متعددی از زوایای مختلف به همراه دو دقیقه ضبط صدای طبیعی ثبت میشود. پس از کسب رضایت رسمی، دو نوع آواتار ایجاد میشود: آواتار شخصی (Personal Avatar) که متنهای ورودی را با چهره (همراه با عینک و بدون عینک) بازخوانی میکند، و دو آواتار تعاملی (Interactive Avatar) که توانایی شنیدن، تحلیل و مکالمه دوجانبه با کاربر را دارند.
برای راهاندازی نسخه تعاملی، محتوای یک مقاله انتخاب شد تا مدل بر پایه آن آموزش ببیند. این آواتار مبتنی بر ترکیبی همافزا از مدلهای تبدیل گفتار به متن (Voice-to-Text)، بینایی و ویدیو، مدل زبانی، و تبدیل متن به گفتار (Text-to-Voice) فعالیت میکند. ساختار فنی این سیستم از مدلهای صوتی و تصویری اختصاصی Synthesia بهره میبرد؛ هرچند این شرکت به مشتریان اجازه میدهد از مدلهای آزمایشگاههای دیگری چون Cartesia، ElevenLabs، Google یا OpenAI نیز استفاده کنند. شرکتها همچنین میتوانند آواتارها را روی سرورهای ابری اختصاصی خود میزبانی کنند یا هزینه میزبانی را به Synthesia بپردازند.
در چرخه پردازش، مدل تبدیل گفتار به متن سخنان کاربر را استخراج میکند؛ سپس یک مدل زبانی مبتنی بر ایجنت مفهوم متن را درک کرده و کنشهای لازم را تعیین میکند. در مرحله بعد مدل تبدیل متن به صوت، پاسخ نهایی را به صدا تبدیل کرده و در نهایت مدل ویدیویی Synthesia حرکت لب، حالات چهره و انیمیشن آواتار را با گفتار همگام میسازد.
بهطور کلی، محصولات استارتاپ Synthesia به سه بخش اصلی تقسیم میشود: یک پلتفرم تولید و انتشار ویدیو با آواتارهای سنتی که متن را میخوانند؛ پلتفرم تعاملی Sessions مبتنی بر ایجنت که برای نظرسنجی و تمرین نقشها کاربرد دارد؛ و پلتفرم رابط برنامهنویسی کاربردی (API) که امکان ادغام مدلهای صوت و تصویر شرکت را با سایر سرویسهای ابری فراهم میآورد.
آمادهسازی این آواتارها چند روز به طول انجامید. در آزمون نسخه شخصی، متنی ساده درباره فرارسیدن فصل پاییز در نیویورک برای آن در نظر گرفته شد. خروجی صدا دقت بالایی داشت و حتی گرفتگی اندک صدا در نمونه ضبطشده اولیه نیز در مدل نهایی برطرف شده بود.
بررسی این ابزار توسط افراد غیرمتخصص نشان داد که این دستاورد در عین جذابیت، احساسی ناخوشایند و تا حدی عجیب (مشابه اثر دره وهمی) ایجاد میکند.
در ادامه، نسخه تعاملی مورد ارزیابی قرار گرفت؛ سیستمی تعیینگرایانه (Deterministic) که تنها در چارچوب متن آموزشی خود پاسخ میدهد. هنگام طرح پرسشهایی درباره سوابق کاری و محل سکونت، سیستم بدون انحراف، بحث را مجدداً به موضوع اصلی مقاله بازگرداند.
اگرچه شباهت ظاهری و لحن صدای نسخه تعاملی به اندازه آواتار شخصی دقیق نبود، اما میزان نزدیکی آن به واقعیت توجه خانواده و نزدیکان را جلب کرد. جالب آنکه اعضای خانواده پس از تلاش برای پرسیدن سوالات کاملاً خصوصی و دیدن مقاومت مدل، با شگفتی روبرو شدند و مادر آزمایشکننده به شوخی اعلام کرد: «به یاد نمیآورم دوقلو به دنیا آورده باشم!»
این تجربه پرسشهای مهمی را درباره آینده حرفه روزنامهنگاری پدید میآورد. آیا مخاطبان پذیرای دریافت اخبار روزانه از زبان یک آواتار هوش مصنوعی خواهند بود؟ برخی سرمایهگذاران بهطور قاطع این ایده را رد میکنند، بهویژه در برههای که انتقادها از ورود محتوای بیکیفیت و ساختگی (AI slop) به شبکههای اجتماعی شدت گرفته است. با این حال، هنوز مشخص نیست که آیا آواتارها جایگزین خبرنگاران خواهند شد یا صرفاً نقش ابزار کمکی را ایفا خواهند کرد، و آیا مدیران ارشد حاضر به مصاحبه با همزاد دیجیتال یک خبرنگار خواهند بود یا خیر.
جوهره اصلی فعالیت خبرنگاری، ایجاد ارتباط انسانی، پژوهش میدانی و فراتر از همه، جلب اعتماد است؛ مؤلفهای حیاتی که بعید به نظر میرسد بتوان آن را به هوش مصنوعی واگذار کرد.
با وجود این، در خارج از فضای رسانه، ایده شبیهسازی دیجیتال میتواند کارایی بالایی داشته باشد. پاسخگویی به مراجعات و پیامهای کاری در دوران تعطیلات و سفر، از جمله مواردی است که یک همزاد مجازی بهخوبی از عهده آن برمیآید.
نحوه بهکارگیری این فناوری در ساختار شرکتهای بزرگ همچنان در حال تکامل است. اما پس از محو شدن جذابیت اولیه، تماشای سکوت آواتار در انتظار پرسش بعدی، حسی غریب به همراه دارد؛ گویی کاربر منتظر پلک زدن، لبخند یا نشانهای است که ثابت کند مدل آنچه را میگوید واقعاً میفهمد.
مدلهای تعیینگرایانه به دلیل طراحی کنترلشده هرگز چنین حسی را شبیهسازی نمیکنند. اما پیوند دادن این کالبد با چتباتهای غیرتعیینگرایانه و مدلهای زبانی آزاد، میتواند زمینهساز توهمات و وابستگیهای روانی به هوش مصنوعی شود.
پیشبینیها نشان میدهد که نسل جدید کاربران (Gen Z) احتمالاً نگاهی محتاطانه و شبیه به فیلمهای علمیتخیلی به دوقلوهای دیجیتال خواهند داشت. با این حال، آواتارهای دیجیتال در مقایسه با رباتهای انساننما دلهره کمتری ایجاد میکنند؛ چراکه در صورت بروز هرگونه رفتار ناهنجار، با بستن پنجره مرورگر میتوان تعامل با آنها را متوقف ساخت.
تا تکامل نهایی این بسترها، بهرهگیری از همزادهای دیجیتال برای ارائه خلاصه مهمترین گزارشهای خبری، تصویری واقعبینانه از آینده پیوند رسانه و هوش مصنوعی ترسیم میکند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.