پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

پایان دوران ویدیوهای نمایشی؛ جنگ تمام‌عیار غول‌های هوش مصنوعی سر کارگردانی دقیق و ثبات صحنه

انتشار:۸ مهر ۱۴۰۵(۲ ساعت پیش)
۸ دقیقه زمان مطالعه
۰ دیدگاه

دوران نمایش کلیپ‌های کوتاه و فریبنده هوش مصنوعی به سر آمده و حالا سازندگانی مثل Kling، Runway و گوگل بر سر ثبات شخصیت‌ها، کنترل دقیق دوربین و کاهش هزینه‌های تولید می‌جنگند. در این رقابت نفس‌گیر، دیگر یک مدل پاسخگوی همه نیازها نیست و استودیوها به سمت ترکیب چند هوش مصنوعی در یک پروژه حرکت می‌کنند.

پایان دوران ویدیوهای نمایشی؛ جنگ تمام‌عیار غول‌های هوش مصنوعی سر کارگردانی دقیق و ثبات صحنه

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • دوران تولید کلیپ‌های تکی و تصادفی به پایان رسیده؛ حالا تیم‌های تولید به دنبال مدل‌هایی هستن که مثل یک کارگردان واقعی، ثبات چهره، نور، لوگو و حرکت دوربین رو حفظ کنن.
  • مدل‌های جدیدی مثل Kling 4.0 و Seedance 2.5 با قابلیت دریافت ده‌ها فریم کلیدی، ورودی‌های چندرسانه‌ای و افزایش طول ویدیو تا ۲ دقیقه، استانداردهای تولید تجاری رو جابه‌جا کردن.
  • آینده ساخت ویدیو به ترکیب چند مدل گره خورده؛ پلتفرم‌هایی مثل ادوبی فایرفلای و هایگزفیلد به تولیدکننده‌ها اجازه میدن برای هر سکانس، اقتصادی‌ترین و دقیق‌ترین هوش مصنوعی رو انتخاب کنن.
US-ENTERTAINMENT-TECHNOLOGY-SXSW
شرکت‌کنندگان در رویداد SXSW مشغول تماشای پروژه «کلید طلایی»؛ داستانی بی‌پایان که با هوش مصنوعی و بر اساس پاسخ‌های تماشاگران ساخته و روایت می‌شود (آستین، تگزاس). در این فستیوال بزرگ سینما، موسیقی و فناوری، هنرمندان از واقعیت مجازی نه برای فرار از انسانیت، بلکه برای ارتباط بهتر با آن استفاده کردند؛ فناوری‌هایی مثل واقعیت مجازی و واقعیت افزوده که معمولاً با بازی‌های ویدیویی یا رقابت سخت‌افزاری غول‌هایی مثل اپل و متا شناخته می‌شوند. (عکس: ژولی ژامو / AFP)

این روز‌ها ویدیوهای هوش مصنوعی مولد به قدری پیشرفت کرده‌اند که صرفاً تولید یک کلیپ جذاب و چشم‌نواز دیگر کسی را شگفت‌زده نمی‌کند. حالا کاربران و فیلم‌سازان به ابزار‌هایی نیاز دارند که نقش تهیه‌کننده، کارگردان، فیلم‌بردار، فیلم‌نامه‌نویس و طراح صحنه را یک‌جا بازی کند. درست در همین راستا، شرکت Kling AI دسترسی زودهنگام به جدید‌ترین مدل ویدیویی خود یعنی Kling 4.0 را آغاز کرده است؛ مدلی که می‌تواند ویدیوهای ۳۰ ثانیه‌ای پیوسته تولید کند، تا ۱۰ فریم کلیدی (Keyframe) را بپذیرد، از فایل‌های مرجع چندرسانه‌ای پشتیبانی کند، صدای استریو بسازد و طول ویدیو را حتی تا ۲ دقیقه افزایش دهد. شاید این مشخصات در نگاه اول فهرستی از اصطلاحات فنی به نظر برسد، اما در واقع نشان‌دهنده یک تغییر بزرگ است: رقابت هوش مصنوعی از ساخت کلیپ‌های ساده عبور کرده و وارد میدان کنترل کامل روی فرایند تولید شده است.

برای تیم‌های خلاق، آژانس‌های تبلیغاتی و کسب‌وکارها، چنین کنترلی حکم آب حیات را دارد! یک کلیپ چندثانیه‌ای فوق‌العاده هیچ ارزشی ندارد اگر در نمای بعدی چهره بازیگر ناگهان تغییر کند، شکل محصول عوض شود، لوگوی برند محو و ناخوانا باشد یا کارگردان نتواند حرکتی را دوباره تکرار کند. کسب‌وکارها سیستمی می‌خواهند که مثل یک عوامل حرفه‌ای دستور بگیرد، تغییرات و اصلاحیه‌ها را بپذیرد و بدون این‌که ساعت‌ها وقت و هزاران توکن را هدر دهد، خروجی آماده و قابل استفاده تحویل دهد.

حالا که مدل‌های پرتعدادی در بازار خروجی‌های باکیفیت ارائه می‌دهند، یک سؤال کلیدی برای شرکت‌های توسعه‌دهنده پیش می‌آید: چه خواهد شد اگر مدل‌های ویدیویی هوش مصنوعی آن‌قدر خوب و جایگزین‌پذیر شوند که کاربران درست مثل مدل‌های زبانی بزرگ، برای هر کار خاص سراغ یک مدل مجزا بروند و دیگر خودشان را به یک شرکت خاص محدود نکنند؟

پیش‌نمایش جدید Kling 4.0؛ قدرت و کنترل بیش‌تر در دست کارگردان

همین هفته شرکت Kling پیش‌نمایشی از نسخه مورد انتظار Kling 4.0 منتشر کرد که تصویر بسیار روشنی از آینده این بازار ترسیم می‌کند. طبق اطلاعات منتشرشده، کاربران می‌توانند تصاویر مرجع، کلیپ‌های ویدیویی و سوژه‌های دلخواه را به مدل بدهند تا شخصیت‌ها، صحنه‌ها و جزئیات بصری دقیقاً مطابق میل آن‌ها تعریف شود. علاوه بر این، Kling اعلام کرده که ویدیوهای تولیدشده را می‌توان تا ۲ دقیقه ادامه داد و گسترش داد.

این مدل از خروجی ۱۰ بیتی HDR با کیفیت‌های 4K و 1080p پشتیبانی می‌کند، خروجی سینمایی با نسبت ۲۱ به ۹ ارائه می‌دهد، صدای دو کاناله استریو تولید می‌کند و هماهنگی لب و دهان (Lip-Sync) را به شکل چشمگیری بهبود بخشیده است. طبق ادعای سازندگان، این مدل قادر است متن‌های چندزبانه، ایموجی‌ها و لوگوها را در طول حرکات پیچیده دوربین و تغییر زاویه صحنه کاملاً ثابت نگه دارد. عرضه عمومی این مدل برای ماه اکتبر برنامه‌ریزی شده است.

وقتی فقط از پرامپت متنی استفاده می‌کنید، دست هوش مصنوعی برای تفسیر باز می‌ماند. این موضوع برای سرگرمی و آزمون‌وخطا خوب است، اما وقتی کارفرمایی یک پلان مشخص می‌خواهد و منتظر اعمال اصلاحات است، این آزادی عمل حسابی گران تمام می‌شود! اینجا است که فریم‌های کلیدی (Keyframes) وارد میدان می‌شوند؛ این فریم‌ها لحظات بصری ثابتی هستند که هوش مصنوعی باید فاصله بین آن‌ها را پر کند. سازنده مشخص می‌کند در چند نقطه کلیدی چه تصاویری قرار داشته باشد و سپس حرکت بین آن‌ها را تولید می‌کند. در این حالت، هوش مصنوعی هنوز سازنده ویدیو است، اما دیگر راهی برای بیراهه رفتن و خلق صحنه‌های نامربوط ندارد.

این کنترل در پروژه‌های تجاری و تبلیغاتی حیاتی است، جایی که آزادی بی حدومرز خلاقیت جایی ندارد! محصول نهایی در ویدیو باید دقیقاً شبیه کالایی باشد که فروخته می‌شود و کاراکترها هم باید تداوم چهره داشته باشند. ممکن است صحنه شروع و پایان یک تیزر از قبل تعیین شده باشد و مدل باید دقیقاً به آن وفادار بماند. به همین ترتیب، قوانین سخت‌گیرانه برندها درباره رنگ، تایپوگرافی و لوگو نیز خط قرمزهایی هستند که هوش مصنوعی موظف به رعایت آن‌ها است.

شتاب رقبا برای حل چالش‌های مشابه؛ میدان نبرد داغ است

شرکت Kling در این بازار شلوغ تنها نیست و رقبای سرسختی کنار خود می‌بیند. بایت‌دنس (ByteDance) در تاریخ ۳۱ ژوئیه مدل Seedance 2.5 را معرفی کرد؛ مدلی با قابلیت تولید ویدیو و صدای ۳۰ ثانیه‌ای، گسترش چندباره طول ویدیو، پذیرش ورودی‌های مرجع متنوع‌تر و ابزار‌های ویرایشی پیشرفته. طبق اعلام بایت‌دنس، در یک نوبت تولید می‌توان تا ۳۰ تصویر، ۱۰ ویدیو و ۱۰ کلیپ صوتی را به عنوان مرجع به سیستم داد. این مدل حتی امکان ویرایش ثانیه‌به‌ثانیه ویدیو را با دستورات متنی فراهم می‌کند و تنظیمات اختصاصی برای زاویه دوربین، پرده سبز و تولیدات پیچیده استودیویی دارد.

استارتاپ MiniMax هم مسیر مشابهی را با مدل H3 در پیش گرفته است. این مدل که ابتدا در ۳۱ ژوئیه معرفی شد و بعداً وزن‌های باز (Open Weights) آن در دسترس قرار گرفت، می‌تواند متن، تصویر، ویدیو و فایل صوتی را به صورت هم‌زمان به عنوان ورودی دریافت کند و ویدیوهای ۱۵ ثانیه‌ای با رزولوشن 2K و صدای استریو بسازد. تمرکز اصلی مینی‌مکس روی کاربردهای تجاری مثل تبلیغات، فروشگاه‌های اینترنتی، طراحی محصول و برندینگ است و توجه ویژه‌ای به نمایش دقیق نوشته‌ها و انتقال طبیعی حرکات دارد.

از طرف دیگر، مدل Gen 4.5 شرکت Runway دستورالعمل‌های دقیق مربوط به طراحی حرکات دوربین، ترکیب‌بندی صحنه و زمان‌بندی رخدادها را اجرا می‌کند. این مدل در حال حاضر در حالت‌های تبدیل متن به ویدیو و تصویر به ویدیو، نماهایی بین ۲ تا ۱۰ ثانیه می‌سازد و به ازای هر ثانیه تولید با Gen 4.5، حدود ۱۲ کردیت از حساب کاربر کسر می‌کند.

مدل Veo 3.1 گوگل هم تمرکز اصلی خود را روی داده‌های مرجع و پیوستگی صحنه‌ها گذاشته است. سازندگان می‌توانند تصاویری برای تعریف کاراکتر، شیء یا کل صحنه به این مدل بدهند، سبک هنری دلخواه‌شان را مشخص کنند، قاب‌بندی و حرکت دوربین را تنظیم نمایند، سکانس‌ها را کش دهند و با دادن فریم اول و آخر، هوش مصنوعی را در مسیر دلخواه‌شان هدایت کنند.

گرچه راهکارهای فنی این شرکت‌ها با هم تفاوت دارد، اما فیلم‌سازان و خریداران تجاری حالا با چند پرسش عملی و یکسان به ارزیابی این مدل‌ها می‌نشینند:

مدل تا چند ثانیه می‌تواند انسجام صحنه را حفظ کند؟ چقدر به دستورات پایبند می‌ماند؟ آیا می‌توان کاراکترها و محصولات را در طول نماها ثابت نگه داشت؟ در صحنه‌های شلوغ و پیچیده چه عملکردی دارد؟ و در نهایت، چند بار باید تلاش کنیم تا به یک ویدیوی واقعاً قابل استفاده برسیم؟

یک پروژه، چند هوش مصنوعی؛ پایان وفاداری به یک مدل خاص

یک یا دو سال پیش، دیدن یک ویدیوی نمایشی براق و جذاب حسابی سر و صدا می‌کرد، اما امروز چنین دموهایی فقط حداقل استاندارد ورود به بازار است!

سرعت سرسام‌آور پیشرفت در بازار هوش مصنوعی، همان‌قدر که برای سازندگان فرصت‌ساز است، چالش‌های بزرگی هم به همراه دارد؛ چراکه پیشرفت مدل‌ها باعث شده جابه‌جایی بین آن‌ها برای کاربران راحت‌تر از همیشه شود.

فرض کنید یک هوش مصنوعی در شبیه‌سازی حرکات بدن انسان عالی است اما روی نوشته‌های بسته‌بندی کالاها به مشکل می‌خورد. مدل دیگری در نماهای نزدیک محصولات فوق‌العاده عمل می‌کند، اما وقتی یک آژانس به ۳۰۰ نسخه مختلف از ویدیو برای شبکه‌های اجتماعی نیاز دارد، هزینه‌اش سر به فلک می‌کشد! مدل سوم هم در اجرای حرکات پیچیده دوربین دست بالا‌تر را دارد. در چنین شرایطی، چرا باید خودمان را به یک ابزار محدود کنیم، وقتی بهترین نتیجه از زنجیر کردن و ترکیب این مدل‌ها به دست می‌آید؟

این رویکرد ترکیبی همین حالا در لایه نرم‌افزاری بالا‌تر از مدل‌ها در حال اجرا است. برای نمونه، شرکت ادوبی (Adobe) در ماه آوریل مدل‌های Kling 3.0 و Kling 3.0 Omni را به پلتفرم Firefly اضافه کرد؛ با این کار، به جای این‌که هنرمندان مجبور شوند محیط کار ادوبی را ترک کنند و مستقیماً وارد سایت Kling شوند، یک مدل متفرقه درست در دل محیط آشنای فایرفلای در دسترس‌شان قرار گرفت.

پلتفرم Magnific (که قبلاً متعلق به Freepik بود) هم مسیر مشابهی را جلو می‌برد. محصولات این شرکت تلاش می‌کنند کل جریان کاری خلق اثر را در یک محیط نگه دارند تا کاربران مجبور نباشند برای استفاده از ابزار‌های مختلف تولید تصویر و ویدیو، مدام بین سایت‌های مختلف سرگردان شوند.

ابزار Canvas از شرکت Higgsfield یک گام هم فراتر رفته و به کاربران اجازه می‌دهد چندین مدل را در قالب یک خط تولید بصری واحد به هم متصل کنند. محیط کاری ویدیویی این سرویس، مدل‌های مختلفی از Kling، بایت‌دنس، گوگل، OpenAI و علی‌بابا را یک‌جا جمع کرده است. با استفاده از API این پلتفرم، توسعه‌دهندگان می‌توانند از یک مدل برای ساخت تصاویر ثابت، از مدل دیگر برای متحرک‌سازی، از یک موتور ارزان‌قیمت برای پیش‌نویس‌های اولیه و در نهایت از یک مدل قدرتمند و گران‌تر برای رندر نهایی پروژه استفاده کنند.

در این فضا، دیگر لازم نیست یک تیم تولید محتوا خود را به عنوان استودیوی اختصاصی Kling، استودیوی Veo یا وفادار به Seedance معرفی کند؛ آن‌ها خیلی ساده برای هر مرحله از کار بهترین مدل را انتخاب می‌کنند و خروجی‌ها را در پلتفرم‌هایی مثل ادوبی فایرفلای، مگنیفیک یا هایگزفیلد سرهم‌بندی می‌نمایند.

برای شرکت‌های سازنده مدل، این ماجرا یک شمشیر دو لبه است؛ توزیع از طریق چنین پلتفرم‌هایی مدل آن‌ها را در معرض دید کاربران بسیار بیشتری قرار می‌دهد، اما هم‌زمان مدل آن‌ها را به یک چرخ‌دنده ساده از یک ماشین بزرگ‌تر تبدیل می‌کند؛ گزینه‌ای میان ده‌ها گزینه دیگر که فقط برای یک نمای خاص یا یک وظیفه کوتاه انتخاب می‌شود، نه شالوده اصلی تمام پروژه.

وقتی کاربر مستقیماً به سایت یک مدل مراجعه می‌کند، آن شرکت مالک تمام تجربه کاربری و ارتباط با مشتری است؛ اما وقتی چندین مدل کنار هم در یک جعبه‌ابزار قرار می‌گیرند، هوش مصنوعی از یک پلتفرم مستقل، به یک موتور صرفاً قابل انتخاب تنزل پیدا می‌کند.

همین موضوع فشار مضاعفی روی سازندگان می‌گذارد تا قابلیت‌هایشان را فراتر از صرفاً «کیفیت ظاهری» ببرند و روی فاکتورهایی مثل هزینه و سرعت تولید، پایداری و ثبات فریم‌ها، و کنترل میلی‌متری حرکات و کارگردانی صحنه تمرکز کنند.

تولید ویدیو اصلاً شبیه ساخت تصویر یا متن نیست؛ اینجا کوچک‌ترین جزئیات تفاوت‌های نجومی ایجاد می‌کنند. به همین دلیل هزینه واقعی یک ویدیوی آماده پخش، به این بستگی دارد که برای رسیدن به آن چند بار مجبور به رندر و آزمون‌وخطا می‌شوید! فرض کنید هزینه هر ثانیه استفاده از مدل الف دو برابر مدل ب باشد، اما مدل الف با ۳ بار رندر نما را تحویل دهد، در حالی که مدل ب به ۱۵ بار تلاش نیاز داشته باشد؛ در عمل، آن مدل به‌اصطلاح ارزان، اصلاً ارزان درنمی‌آید! این بدون احتساب ساعت‌ها وقتی است که باید برای پرامپت‌نویسی و بررسی مداوم خروجی‌ها تلف کنید.

برای حل این مشکل و کاهش زمان تست، شرکت Kling نسخه سریع‌تر و ارزان‌تری با نام Kling 4.0 Flash را معرفی کرده که خوراکِ تکرار مداوم و پیش‌نویس‌های اولیه است. بدون شک به‌زودی شاهد معرفی مدل‌های سبک و پرسرعت مشابه از سوی سایر رقبا نیز خواهیم بود تا هزینه و زمان تست سکانس‌ها برای سازندگان به حداقل برسد.

با به بلوغ رسیدن بازار هوش مصنوعی، این فضا دیگر شبیه یک مسابقه پر زرق‌وبرق برای نمایش شوآف‌های چشم‌گیر نیست، بلکه به مجموعه‌ای از موتورهای فنی و ابزار‌های هماهنگ‌کننده برای تولید حرفه‌ای تبدیل شده است. ما در حال ورود به دورانی عقلانی‌تر و پخته‌تر در هوش مصنوعی هستیم؛ دورانی که خودنمایی در آن رنگ باخته و یک سؤال ساده اهمیت پیدا کرده است: «آیا این ابزار همین حالا گره از کار من باز می‌کند یا نه؟»

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

آپدیت هیجان‌انگیز ویرایشگر Zed: انتخاب مدل هوش مصنوعی برای هر ساب‌ایجنت حین کدنویسی!
آخرین اخبار

آپدیت هیجان‌انگیز ویرایشگر Zed: انتخاب مدل هوش مصنوعی برای هر ساب‌ایجنت حین کدنویسی!

ویرایشگر محبوب Zed در نسخه ۱.۲۲ سیستم چندایجنت (Multi-Agent) خود را به سطحی کاملاً تازه برده است. در این به‌روزرسانی، ایجنت اصلی می‌تواند به دلخواه خود برای هر ساب‌ایجنت یک مدل مجزا تعیین کند تا هزینه و سرعت توسعه به شکل چشمگیری بهینه‌سازی شود. همچنین با اضافه شدن فشرده‌سازی خودکار کانتکست، پردازش وظایف طولانی و پیچیده بدون وقفه انجام خواهد شد.

۳ دقیقه مطالعه
۰
۸ مهر
درگاه Monid متن‌باز شد؛ دسترسی ایجنت‌های هوش مصنوعی به بیش از ۲۰۰۰ ابزار فقط با یک API
آخرین اخبار

درگاه Monid متن‌باز شد؛ دسترسی ایجنت‌های هوش مصنوعی به بیش از ۲۰۰۰ ابزار فقط با یک API

پلتفرم Monid درگاه یکپارچه ابزار‌های هوش مصنوعی خود را در گیت‌هاب متن‌باز کرد تا ایجنت‌ها بتوانند تنها با یک کلید API به بیش از ۲۰۰۰ ابزار کاربردی از ۷۲ ارائه‌دهنده متصل شوند. این پروژه همانند پلتفرم OpenRouter عمل می‌کند، با این تفاوت که به جای مدل‌های زبانی، دسترسی ایجنت‌ها به ابزار‌های وب، منابع داده و سرویس‌های تولید محتوا را در قالب یک درگاه واحد مدیریت می‌کند.

۲ دقیقه مطالعه
۰
۸ مهر
ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!
آخرین اخبار

ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!

شرکت متا با یک ترفند حسابداری زیرکانه و ثبت رک‌های سرور هوش مصنوعی به عنوان «تجهیزات آزمایشی»، توانسته معافیت مالیاتی پژوهشی خود را به رقم سرسام‌آور ۳.۹ میلیارد دلار برساند. کارشناسان مالیاتی این اقدام را از نظر قانونی بسیار پرریسک و مشکوک می‌دانند، اما در صورت تأیید، راه برای معافیت‌های مالیاتی نجومی سایر غول‌های هوش مصنوعی نیز هموار خواهد شد.

۴ دقیقه مطالعه
۰
۸ مهر