پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

آموزش فیزیک واقعی به هوش مصنوعی ویدیوساز؛ فریم‌ورک Physis-Lang انویدیا مدل Veo 3.1 گوگل را شکست داد

انتشار:۸ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

انویدیا با معرفی فریم‌ورک متن‌باز Physis-Lang، یکی از بزرگ‌ترین نقطه‌ضعف‌های هوش مصنوعی در تولید ویدیو را هدف گرفته و قوانین دنیای واقعی مثل جاذبه و گرما را به مدل‌ها آموزش می‌دهد. این سیستم با غنی‌سازی پرامپت‌ها و داده‌های آموزشی بر اساس علت و معلول، توانسته حتی از مدل قدرتمند Veo 3.1 گوگل هم در درک فیزیک پیشی بگیرد.

آموزش فیزیک واقعی به هوش مصنوعی ویدیوساز؛ فریم‌ورک Physis-Lang انویدیا مدل Veo 3.1 گوگل را شکست داد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • انویدیا فریم‌ورک Physis-Lang رو معرفی کرده که با افزودن استدلال‌های فیزیکی به توضیحات ویدیو، سوتی‌های معروفی مثل ذوب شدن کره رو به بالا یا رد شدن اجسام از دل هم رو کاملاً برطرف می‌کنه.
  • این نوآوری حتی بدون تغییر وزن‌های مدل و صرفاً با غنی‌سازی پرامپت‌ها، جهش ۵.۶۲ امتیازی ایجاد کرده و در مدل Cosmos 3 Nano موفق شده مدل مشهور Veo 3.1 گوگل رو شکست بده.
  • سیستم با داشتن یک هوش مصنوعی منتقد، خطاهای ویدیویی رو شناسایی می‌کنه و با یک چرخه بازخورد هوشمند، فیزیک پدیده‌های دشواری مثل گرما، تغییر فاز و تغییر شکل اجسام رو ارتقا میده.

آموزش قوانین فیزیک به مدل‌های ویدیویی با کپشن‌های هوشمند Physis-Lang انویدیا

محققان شرکت انویدیا (NVIDIA) به‌تازگی از یک فریم‌ورک متن‌باز به نام Physis-Lang رونمایی کرده‌اند که توضیحات و مفاهیم فیزیکی را وارد کپشن‌ها و پرامپت‌های مدل‌های هوش مصنوعی تولید ویدیو می‌کند. این دستاورد مستقیماً روی یکی از باگ‌ها و نقطه‌ضعف‌های همیشگی ویدیوهای هوش مصنوعی دست گذاشته است؛ جایی که حتی در طبیعی‌ترین فریم‌ها هم ممکن است کره‌ای را ببینید که خلاف جهت جاذبه به سمت بالا ذوب می‌شود، اجسام جامد از دل هم رد می‌شوند یا پارچه‌ها طوری حرکت می‌کنند که گویی هیچ وزن، اصطکاک و کششی ندارند.

به‌طور سنتی، کپشن‌های آموزشی تنها اشیا، اعمال و تغییرات زمانی را برای مدل توصیف می‌کنند؛ اما Physis-Lang این نظارت را با افزودن «علت»، «قوانین حاکم فیزیکی» و «معلول» حسابی ارتقا می‌دهد. برای نمونه، در صحنه ذوب شدن کره، کپشن جدید به‌دقت توضیح می‌دهد که چگونه گرما دما را بالا می‌برد، ماده دچار تغییر فاز می‌شود، نیروی گرانش توده نرم‌شده را شکل می‌دهد و در نهایت یک لایه مایع تشکیل می‌شود. این فریم‌ورک از این ادبیات دقیق برای بازنویسی کپشن ویدیوهای آموزشی و همچنین بسط دادن پرامپت‌های کاربران پیش از آغاز فرآیند تولید ویدیو استفاده می‌کند.

پرامپت‌های دقیق‌تر، نمرات فیزیک هوش مصنوعی را بالا می‌برند

در بررسی بنچمارک معتبر Physics-IQ Verified، نسخه‌های ارتقایافته مدل‌های Cosmos 3 Super و Cosmos 3 Nano با کمک Physis-Lang توانسته‌اند جایگاه اول و دوم جدول را تصاحب کنند. این بنچمارک با دقت می‌سنجد که ویدیوهای تولیدشده چقدر به رفتارهای فیزیکی دنیای واقعی وفادار مانده‌اند.

پیکربندی
امتیاز
ترکیب Physis-Lang با Cosmos 3 Super
۴۸.۲٪
ترکیب Physis-Lang با Cosmos 3 Nano
۴۳.۳٪
مدل پایه Cosmos 3 Super
۴۲.۷٪
مدل Seedance 2.5
۴۲.۴٪
امتیازات جدول رده‌بندی بنچمارک Physics-IQ قبل و بعد از اعمال Physis-Lang
پیکربندی‌های مبتنی بر Physis-Lang در مقایسه بنچمارک Physics-IQ Verified پیشتاز هستند.

یک آزمایش جداگانه در زمان استنتاج (بدون آموزش مجدد مدل) تأثیر چشمگیر بسط پرامپت را اثبات کرده است. جالب اینجاست که تنها با افزودن استدلال‌های فیزیکی به ورودی کاربر، امتیاز بنچمارک PhyGenBench در مدل Cosmos 3 به میزان ۵.۶۲ امتیاز رشد کرده است؛ آن هم با وزن‌های کاملاً ثابت مدل و بدون نیاز به آموزش اضافی. از آنجا که این روش تنها متن ورودی فرستاده‌شده به مدل ویدیوساز را دگرگون می‌کند، می‌توان آن را مستقیماً روی مدل‌ها و چک‌پوینت‌های موجود در بازار پیاده‌سازی کرد.

یک منتقد هوشمند قوانین کپشن‌نویسی را بازنویسی می‌کند

این فریم‌ورک یک زبان واحد و ساختاریافته فیزیکی را در سه مرحله متوالی به اشتراک می‌گذارد تا از طریق بازخورد هوش مصنوعی منتقد و تحلیل خطاها، متن‌های به‌کاررفته در آموزش و تولید ویدیو مدام بهبود پیدا کنند:

  1. بهینه‌سازی زبان توصیف: یک منتقد آگاه به فیزیک تک‌تک کپشن‌ها را زیر ذره‌بین می‌گذارد تا ادعاهای مفقود یا گزاره‌هایی را که در ویدیو دیده نمی‌شوند شناسایی کند. سپس یک ایجنت هوشمند دستورالعمل‌های کپشن‌نویسی را به‌روزرسانی می‌کند، در حالی که مدل کپشن‌نویس در طول این فرآیند دست‌نخورده و ثابت می‌ماند.
  2. شناسایی و بازیابی پدیده‌های ضعیف: ویدیوهایی که مدل در تولید آن‌ها ناموفق بوده، به کوئری‌های جستجو تبدیل می‌شوند. سپس سیستم بازیابی مبتنی بر زبان، ویدیوهای متفاوتی را که دقیقا شامل همان پدیده‌های فیزیکی چالش‌برانگیز هستند، برای آموزش گلچین می‌کند.
  3. آموزش و تولید: دستورالعمل‌های بازبینی‌شده داده‌های آموزشی را بازنویسی کرده و پرامپت‌های استنتاج را بسط می‌دهند. همچنین توصیف‌های منفی اختصاصی برای هر صحنه، رفتارهای غیرواقعی فیزیک را مشخص می‌کنند تا ژنراتور مدل جلوی ایجاد آن‌ها را بگیرد.
نمودار خط لوله پالایش کپشن، بازیابی، آموزش و تولید ویدیو در Physis-Lang
حلقه بازخورد، دستورالعمل‌های کپشن‌نویسی را به‌روزرسانی کرده، ویدیوهای مرتبط را بازیابی می‌کند و از زبان فیزیکی حاصل در سراسر فرآیند بهره می‌برد.

بنچمارک PhysCapBench بررسی می‌کند که آیا کیفیت کپشن‌ها مستقل از فرآیند تولید ویدیو ارتقا یافته است یا خیر. این ارزیابی شامل ۲۴۶ ویدیوی بازبینی‌شده و ۳۷۹۴ گزاره فیزیکی تأییدشده توسط انسان است که به طور میانگین به ۱۵.۴ گزاره برای هر ویدیو می‌رسد. ارزیاب‌ها هر کپشن تولیدشده را به ادعاهای جزئی تفکیک می‌کنند، این ادعاها را با ویدیوی اصلی تطبیق می‌دهند و سپس معیارهای دقت (Precision)، فراخوانی (Recall) و نمره متوازن F1 را محاسبه می‌کنند.

معیار
امتیاز اولیه
امتیاز نهایی
امتیاز F1 کپشن در PhysCapBench
۷۸.۶۴
۸۷.۸۲
امتیاز نهایی در PhyGenBench
۶۴.۱۷
۶۷.۲۹

خطاها کلیپ‌های آموزشی بعدی را تعیین می‌کنند

در آزمون دشوار VideoPhy-2 Hard، فرآیند بازیابی هدفمند توانست نمرات ترکیبی را در هر هشت دسته‌بندی مورد ارزیابی ارتقا دهد. میزان این رشد چشمگیر از ۱.۲۳ امتیاز در حوزه خاصیت کشسانی و الاستیسیته آغاز شده و تا ۸.۰۰ امتیاز در فرآیندهای حرارتی و شیمیایی افزایش یافته است.

دسته‌بندی
میزان رشد نمره ترکیبی
فرآیندهای حرارتی
+۸.۰۰
فرآیندهای شیمیایی
+۸.۰۰
مکانیک شکست و ترک
+۷.۴۵
حرکت اجسام انعطاف‌پذیر (Soft-body)
+۷.۴۱
تغییر شکل پارچه
+۷.۱۹
حرکت اجسام صلب (Rigid-body)
+۶.۰۶
برخورد و اصطکاک
+۳.۴۵
الاستیسیته و کشسانی
+۱.۲۳

بیش‌ترین میزان جهش در فرآیندهایی رخ داده که توسط متغیرهای پنهان و نامرئی هدایت می‌شوند؛ متغیرهایی مانند دما، فاز ماده یا ترکیبات شیمیایی. توصیف‌های دقیق علت و معلولی سیگنال‌های هدایت‌کننده‌ای را فراهم می‌کنند که حتی پیشرفته‌ترین فریم‌ها نیز به تنهایی قادر به نشان دادن مستقیم آن‌ها نیستند.

موفقیت روی معماری‌ها و مدل‌های مختلف

بر اساس جدول پنجم مقاله منتشرشده، این متد روی تمام معماری‌های آزمایش‌شده—از مدل‌های کوچک ۴ میلیارد پارامتری گرفته تا غول‌های ۶۴ میلیارد پارامتری—رشد کاملاً مثبتی را به ثبت رسانده است.

مدل پایه (Backbone)
تعداد پارامترها
میانگین رشد امتیاز
مدل Wan 2.1
۱۴ میلیارد
+۷.۰۵
مدل Cosmos 3 Edge
۴ میلیارد
+۳.۲۴
مدل Cosmos 3 Nano
۱۶ میلیارد
+۶.۲۲
مدل Cosmos 3 Super
۶۴ میلیارد
+۵.۰۲

نکته شگفت‌انگیز اینجاست که ترکیب Physis-Lang با مدل ۱۶ میلیارد پارامتری Cosmos 3 Nano توانسته در بنچمارک PhyGenBench حتی از مدل قدرتمند Veo 3.1 گوگل هم جلو بزند، هرچند در آزمون جامع VideoPhy-2 All فاصله‌ای بسیار اندک با آن دارد.

سیستم
PhyGenBench
VideoPhy-2 Hard
مدل Cosmos 3 Nano با فریم‌ورک Physis-Lang
۷۱.۰۴
۶۲.۳۶
مدل Veo 3.1 گوگل
۶۵.۶۳
۵۸.۴۳

مرزها و محدودیت‌های بنچمارک‌ها

افزایش ۵.۶۲ امتیازی نشان‌دهنده قدرت جادویی بسط پرامپت با وزن‌های ثابت مدل است. البته خط لوله کامل Physis-Lang از داده‌های بازکپشن‌شده و بازیابی مبتنی بر شکست نیز بهره می‌برد؛ بنابراین دستاوردهای نهایی حاصل ترکیب پالایش زبانی، انتخاب هوشمندانه داده، آموزش مدل و پرامپت‌نویسی دقیق در لحظه استنتاج است.

با تمام این پیشرفت‌ها، باید واقع‌بین بود؛ شواهد کمّی به پدیده‌های منتخب بنچمارک‌ها محدود است و بالا‌ترین امتیاز بنچمارک Physics-IQ Verified هنوز روی ۴۸.۲ درصد ایستاده است. شبیه‌سازی همه‌جانبه فیزیک، حفظ ثبات در ویدیوهای طولانی‌مدت و نحوه عملکرد مدل در برابر قوانین فیزیکی نادیده‌گرفته‌شده، همچنان سوالاتی بزرگ و بی‌پاسخ هستند و نیازمند بررسی‌های انسانی و آزمایش روی پدیده‌های پیچیده‌تر خواهند بود.

کپشن‌ها؛ اهرم جدید کنترل در دستان توسعه‌دهندگان

کپشن‌های آگاه به قوانین فیزیک، راهکاری مستقل از مدل در اختیار توسعه‌دهندگان می‌گذارند تا ساختار علّی و معلولی را به هوش مصنوعی تزریق کنند. کپشنی که نیروها، تغییرات حالت ماده و پیامدهای مورد انتظار را نام می‌برد، راهنمایی زمانی بسیار عمیق‌تری نسبت به توصیف ظاهری اشیا و حرکات سطحی ارائه می‌دهد. این رویکرد مستقیماً روی لایه داده و پرامپت می‌نشیند و به همین دلیل می‌توان از آن روی مدل‌های فعلی بدون دردسر استفاده کرد.

توسعه‌دهندگان می‌توانند کار را خیلی ساده و با بسط پرامپت در زمان استنتاج شروع کنند: یک ساختار علت و معلولی مشخص تعریف کنید، پرامپت‌های ورودی را غنی‌تر سازید، مدل اصلی را دست‌نخورده نگه دارید و عملکرد آن را بسنجید. برای پیاده‌سازی عمیق‌تر در فاز آموزش نیز می‌توان بازکپشن‌نویسی با نظارت منتقد و بازیابی موارد شکست را برای آموزش مدل به کار گرفت. همین جریان کاری جذاب را می‌توان در سایر سیستم‌های هوش مصنوعی مولد که متکی به توصیف صحنه‌ها هستند نیز پیاده کرد.

جزئیات کامل فریم‌ورک، تعریف بنچمارک‌ها، نتایج آزمایش‌ها و گالری ویدیوهای خیره‌کننده شامل پدیده‌هایی مثل برخوردها، پاره شدن اجسام، خیس شدن سطوح و تغییر شکل تحت فشار، در صفحه رسمی پروژه و مقاله انویدیا در دسترس علاقه‌مندان قرار گرفته است.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

آپدیت هیجان‌انگیز ویرایشگر Zed: انتخاب مدل هوش مصنوعی برای هر ساب‌ایجنت حین کدنویسی!
آخرین اخبار

آپدیت هیجان‌انگیز ویرایشگر Zed: انتخاب مدل هوش مصنوعی برای هر ساب‌ایجنت حین کدنویسی!

ویرایشگر محبوب Zed در نسخه ۱.۲۲ سیستم چندایجنت (Multi-Agent) خود را به سطحی کاملاً تازه برده است. در این به‌روزرسانی، ایجنت اصلی می‌تواند به دلخواه خود برای هر ساب‌ایجنت یک مدل مجزا تعیین کند تا هزینه و سرعت توسعه به شکل چشمگیری بهینه‌سازی شود. همچنین با اضافه شدن فشرده‌سازی خودکار کانتکست، پردازش وظایف طولانی و پیچیده بدون وقفه انجام خواهد شد.

۳ دقیقه مطالعه
۰
۸ مهر
درگاه Monid متن‌باز شد؛ دسترسی ایجنت‌های هوش مصنوعی به بیش از ۲۰۰۰ ابزار فقط با یک API
آخرین اخبار

درگاه Monid متن‌باز شد؛ دسترسی ایجنت‌های هوش مصنوعی به بیش از ۲۰۰۰ ابزار فقط با یک API

پلتفرم Monid درگاه یکپارچه ابزار‌های هوش مصنوعی خود را در گیت‌هاب متن‌باز کرد تا ایجنت‌ها بتوانند تنها با یک کلید API به بیش از ۲۰۰۰ ابزار کاربردی از ۷۲ ارائه‌دهنده متصل شوند. این پروژه همانند پلتفرم OpenRouter عمل می‌کند، با این تفاوت که به جای مدل‌های زبانی، دسترسی ایجنت‌ها به ابزار‌های وب، منابع داده و سرویس‌های تولید محتوا را در قالب یک درگاه واحد مدیریت می‌کند.

۲ دقیقه مطالعه
۰
۸ مهر
ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!
آخرین اخبار

ترفند ۳.۹ میلیارد دلاری متا؛ تبدیل دیتاسنترهای هوش مصنوعی به تخفیف مالیاتی نجومی!

شرکت متا با یک ترفند حسابداری زیرکانه و ثبت رک‌های سرور هوش مصنوعی به عنوان «تجهیزات آزمایشی»، توانسته معافیت مالیاتی پژوهشی خود را به رقم سرسام‌آور ۳.۹ میلیارد دلار برساند. کارشناسان مالیاتی این اقدام را از نظر قانونی بسیار پرریسک و مشکوک می‌دانند، اما در صورت تأیید، راه برای معافیت‌های مالیاتی نجومی سایر غول‌های هوش مصنوعی نیز هموار خواهد شد.

۴ دقیقه مطالعه
۰
۸ مهر