پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی از مدل جهان Odyssey-3؛ آموزش قوانین فیزیک به ربات‌ها از دل ویدیو!

انتشار:۱۷ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Odyssey از مدل جهان پیشرفته Odyssey-3 رونمایی کرد؛ مدلی تعاملی که با تبدیل متن به محیط‌های سه‌بعدی و شبیه‌سازی دقیق فیزیک، کنترل ربات‌ها و خودروهای خودران را متحول می‌کند. این سیستم با یک هسته بصری یکپارچه، امکان آموزش رفتارهای پیچیده فیزیکی را بدون نیاز به داده‌های پرهزینه فراهم کرده و به صورت پیش‌نمایش پژوهشی در دسترس قرار گرفته است.

رونمایی از مدل جهان Odyssey-3؛ آموزش قوانین فیزیک به ربات‌ها از دل ویدیو!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ Odyssey از مدل جهان جدید خود با نام Odyssey-3 رونمایی کرد؛ سیستمی تعاملی که با تولید ویدیو و پیش‌بینی حرکت اجسام، به ربات‌ها و خودروها یاد می‌دهد چطور در دنیای واقعی عمل کنند.
  • این مدل در بنچمارک فیزیک Physics-IQ با ثبت امتیاز ۶۶.۱ توانست رقبای سرشناسی مثل FLUX 3 و NVIDIA Cosmos را پشت سر بگذارد؛ هرچند این رکورد با ترفند انتخاب بهترین خروجی از میان ۸ نمونه به دست آمده است.
  • بزرگ‌ترین برگ برنده این فناوری، استفاده از یک هسته مشترک برای بازوهای رباتیک، ربات‌های انسان‌نما و خودروهای خودران است که نیاز به جمع‌آوری داده‌های پرهزینه را به شدت کاهش می‌دهد.

پیوند ویدیوهای تعاملی با هدایت فیزیکی در Odyssey-3

استارتاپ Odyssey رسماً از Odyssey-3 رونمایی کرد؛ یک مدل پایه جهان (World Model) که می‌تواند تنها با یک پرامپت متنی ساده، محیط‌هایی تعاملی و قابل‌گشت‌وگذار بسازد و دقیقاً پیش‌بینی کند که با حرکات یک انسان یا ایجنت نرم‌افزاری، صحنه چطور دستخوش تغییر می‌شود. پیش‌نمایش پژوهشی و رایگان این مدل هم‌اکنون در دسترس عموم قرار گرفته و توسعه‌دهندگانی که روی ربات‌ها یا خودروهای خودران کار می‌کنند، می‌توانند برای دسترسی به API اختصاصی آن درخواست دهند.

هسته اصلی Odyssey-3 بر پایه یک «دیفیوژن ترنسفورمر خودبازگشتی» (Autoregressive Diffusion Transformer) ساخته شده است؛ یعنی وضعیت‌های بصری را با حذف گام‌به‌گام نویز تولید کرده و سپس هر وضعیت جدید را بر اساس مشاهدات قبلی و دستورات کنترلی تنظیم می‌کند. تیم Odyssey همین ستون فقرات یا بک‌بون پیش‌آموزش‌دیده را طوری طراحی کرده که هم‌زمان برای سه کاربرد مهم پاسخگو باشد: شبیه‌سازی تعاملی، کنترل ماشین‌های فیزیکی و آموزش ایجنت‌ها. استفاده مجدد از همین ساختار واحد، نیاز به جمع‌آوری کوهی از داده‌های اختصاصی و توان پردازشی سنگین برای هر ربات، خودرو یا محیط شبیه‌سازی را حسابی کاهش می‌دهد.

پیشتازی در درک قوانین فیزیک به همراه یک شرط پردازشی مهم

بنچمارک معتبر Physics-IQ Verified بررسی می‌کند که آیا یک مدل هوش مصنوعی می‌تواند ویدیوهای آزمایش‌های واقعی را طوری ادامه دهد که رفتارهای فیزیکی در دینامیک مایعات، نورشناسی (اپتیک)، مکانیک جامدات، مغناطیس و ترمودینامیک کاملاً حفظ شوند یا نه. بر اساس نتایج منتشرشده در زمان رونمایی، نسخه پیشرفته Odyssey-3 Pro موفق شد بالا‌ترین امتیاز ثبت‌شده در بخش «ویدیو به ویدیو» را از آن خود کند.

بنچمارک
نتیجه
شرایط و جزئیات ارزیابی
بخش ویدیو به ویدیو در Physics-IQ Verified
۶۶.۱
مدل Odyssey-3 Pro با کیفیت 720p و روش نمونه‌گیری هشت‌تایی؛ بالا‌تر از مدل FLUX 3 شرکت Black Forest Labs و نسخه‌های NVIDIA Cosmos 3.
بخش تصویر به ویدیو در Physics-IQ Verified
۵۴.۷
مدل Odyssey-3 Pro با استفاده از روش نمونه‌گیری هشت‌تایی.
بنچمارک WorldMark (دید اول‌شخص استایلایز)
رتبه اول
رتبه‌بندی بر اساس میانگین ۱۳ معیار گزارش‌شده با کپشن‌های WorldMark.
بنچمارک WorldMark (دید سوم‌شخص واقعی و استایلایز)
رتبه اول
مدل Odyssey-3 در هر دو بخش دید سوم‌شخص صدرنشین شد.
بنچمارک WorldMark (دید اول‌شخص واقعی)
۸۰.۶ (رتبه سوم)
پس از مدل‌های Lyra 2.0 با امتیاز ۸۴.۴ و AlayaWorld با امتیاز ۸۳.۰.

البته در این میان یک نکته پردازشی قابل‌توجه وجود دارد: امتیاز ۶۶.۱ در بنچمارک Physics-IQ با تکنیک «انتخاب بهترین از میان ۸ خروجی» (Best-of-Eight) به دست آمده که طبیعتاً توان پردازشی به مراتب بیشتری نسبت به یک تولید معمولی می‌طلبد. هرچند سازندگان مدعی شده‌اند که مدل پایه توانسته تعادل بهتری میان دقت فیزیکی و هزینه تولید برقرار کند، اما گزارش‌های اولیه بیش‌تر به نمودارهای مقایسه‌ای بسنده کرده‌اند و هنوز خبری از قیمت‌گذاری شفاف API یا میزان تأخیر سخت‌افزاری مشخص نیست.

آموزش رابطه علت و معلول با سه منبع داده مکمل

تیم Odyssey این مدل را با تکیه بر سه منبع داده‌ای مکمل آموزش داده که هر کدام گوشه‌ای از پازل مدل‌سازی دنیای تعاملی را تکمیل می‌کنند:

  • ویدیوهای سطح اینترنت: این داده‌ها گستره وسیعی از جلوه‌های بصری دنیای واقعی را به همراه برچسب‌گذاری رویدادها در بازه‌های زمانی مشخص در اختیار مدل می‌گذارند.
  • ویدیوهای ضبط‌شده از گیم‌پلی بازی‌ها: این فریم‌ها دقیقاً با ورودی‌های همگام صفحه‌کلید و ماوس جفت شده‌اند تا مدل مستقیماً ببیند هر تصمیم و عمل چه نتیجه‌ای را در صحنه رقم می‌زند.
  • شبیه‌سازی اجسام صلب (Rigid-body): این شبیه‌سازی‌ها تعاملات فیزیکی کنترل‌شده را همراه با توضیحات متنی و متادیتا ارائه می‌دهند تا یادگیری رابطه علت و معلولی برای هوش مصنوعی به مراتب شفاف‌تر شود.

زیر کاپوت فناوری دیفیوژن آنلاین و بی‌درنگ

معماری پایه این سیستم یک دیفیوژن ترنسفورمر ویدیویی چندمرحله‌ای است که از امبدینگ‌های موقعیتی چرخشی زمانی (یا همان RoPE) برای کدگذاری ترتیب فریم‌ها بهره می‌برد. همچنین سازوکار «پوشش علیتی» (Causal Masking) مانع از آن می‌شود که مدل فریم‌های آینده را ببیند؛ بنابراین سیستم ناچار است وضعیت بعدی صحنه را فقط بر اساس مشاهدات گذشته پیش‌بینی کند. در طول فرایند آموزش، روش Teacher Forcing مشاهدات درست قبلی را به مدل تزریق می‌کند و هنگام تولید زنده، مدل از خروجی‌های قبلی خودش ادامه می‌دهد و هم‌زمان دستورات و ورودی‌های کنترلی جدید را تحویل می‌گیرد.

تیم سازنده برای این‌که تأخیر تعاملات به حداقل برسد، نمونه‌بردار دیفیوژن اصلی را در قالب یک مدل چندمرحله‌ای بسیار سریع فشرده کرده است. مراحل پس‌آموزش (Post-training) نیز شامل تقطیر مبتنی بر تطبیق توزیع (که یاد می‌دهد چطور یک مدل سریع‌تر همان خروجی مدل کند اولیه را بازتولید کند) در کنار تمایزدهنده‌های زایای رقابتی (GAN) و یادگیری تقویتی است. البته این استارتاپ هنوز نرخ فریم دقیق، طول کانتکست یا نیازمندی‌های سخت‌افزاری لازم برای اجرای این پیش‌نمایش را به صورت عمومی اعلام نکرده است.

یک مغز متفکر برای سه دنیای فیزیکی متفاوت

استارتاپ Odyssey برای منطبق‌کردن این ستون فقرات بصری با سیستم‌های فیزیکی، آن را کاملاً قفل (Freeze) نگه می‌دارد و فقط یک پالیسی یا رمزگشای عمل اختصاصی را بر اساس جفت مشاهدات و اقدامات آموزش می‌دهد. قفل‌کردن بک‌بون باعث حفظ وزن‌های پیش‌آموزش‌دیده می‌شود و در عین حال، به پالیسی سبک‌تر اجازه می‌دهد کنترل دستگاه موردنظر را یاد بگیرد:

  • بازوهای رباتیک: طبق گزارش Odyssey، پالیسی‌هایی که تنها با چند ده ساعت داده نمایشی آموزش دیده‌اند، وظایف جابه‌جایی اشیا را با موفقیت انجام داده و حتی در مواقع بروز خطا (که در داده‌های آموزشی نبوده) عملکرد خود را بازیابی کرده‌اند؛ مثلاً اگر گریپر ربات در گرفتن یک شیء خطا کند، زاویه‌اش را اصلاح کرده یا جسمی را که در موقعیتی نامتعارف افتاده دوباره برمی‌دارد.
  • ربات‌های انسان‌نما: شرکت Flexion پالیسی ربات‌های انسان‌نمای خود را بر پایه Odyssey-3 توسعه داده است. این سیستم‌ها در مواجهه با تغییرات محیطی عملکرد به مراتب بهتری نسبت به مدل‌های پایه‌ای تصویر-زبان-عمل (VLA) نشان داده و حتی زیر نورهای متغیری که بقیه سیستم‌ها را مختل می‌کرد، بدون مشکل به کار ادامه دادند.
  • خودروهای خودران: تیم سازنده بدون کوچک‌ترین دستکاری در ستون فقرات اصلی، یک پالیسی رانندگی را تنها با ۲۰ ساعت داده رانندگی در جاده‌های هند آموزش داد. این پالیسی با تکیه بر بازنمایی‌های بصری مدل، نقاط مسیر (Waypoints) را پیش‌بینی کرده و به صورت حلقه بسته حرکت می‌کند؛ به این معنا که هر پیش‌بینی مستقیماً مشاهده و اقدام بعدی را هدایت می‌کند.

قفل‌کردن بک‌بون اصلی هزینه انطباق را به شدت کاهش می‌دهد، چرا که هر ساختار فیزیکی به جای یک مدل بصری تازه، فقط به یک پالیسی کوچک‌تر نیاز دارد. با این حال، شواهد فعلی منحصر به دموها و بنچمارک‌های اعلام‌شده توسط خود Odyssey است و برای اثبات ایمنی و کارایی در ماشین‌ها و محیط‌های ناآشنا، به ارزیابی‌های مستقل و دقیق نیاز است.

آموزش ایجنت‌ها درون جهان‌های شبیه‌سازی‌شده

مدل Odyssey-3 در فرایند آموزش ایجنت‌ها نقش محیطی را بازی می‌کند که مشاهدات را تولید کرده و به اکشن‌ها پاسخ می‌دهد. در دموی انجام وظایف، یک ایجنت هدفی به زبان طبیعی دریافت می‌کند، صحنه ساخته‌شده را زیر نظر می‌گیرد و تا رسیدن به نتیجه مطلوب، اقدامات متوالی انجام می‌دهد.

محیط‌های تولیدشده توسط هوش مصنوعی می‌توانند سناریوهای بی‌شمار و متنوعی خلق کنند؛ آن هم بدون این‌که نیازی به ربات‌های فیزیکی واقعی یا طراحی دستی صحنه‌ها با نرم‌افزارهای سه‌بعدی باشد. با این حال، نقطه ضعف ماجرا اینجاست که خطاهای مدل جهان مستقیماً به فرایند آموزش سرایت می‌کنند؛ یعنی اگر دینامیک صحنه غیرواقعی باشد، حافظه بلندمدت ضعف نشان دهد یا موقعیت‌های پیش‌بینی‌نشده به درستی لحاظ نشوند، ایجنت ممکن است رفتارهای نادرستی بیاموزد. شرکت ادیسه هنوز گزارشی از نرخ موفقیت در انجام وظایف، هزینه‌های آموزش یا نتایج انتقال از شبیه‌سازی به دنیای واقعی (Sim-to-Real) برای این سناریو منتشر نکرده است.

ابهامات و نکات مهمی که توسعه‌دهندگان باید زیر نظر بگیرند

  • پایداری در سناریوهای طولانی: معیار سنجش حافظه جهان در بنچمارک WorldMark درون میانگین ۱۳ شاخص ادغام شده و جزئیات دقیقی از این‌که صحنه‌ها تا چه مدت یکپارچگی خود را حفظ می‌کنند، در دست نیست.
  • میزان واقع‌گرایی در دید اول‌شخص: مدل Odyssey-3 در بخش دید اول‌شخص واقعی در بنچمارک WorldMark پس از Lyra 2.0 و AlayaWorld در جایگاه سوم قرار دارد.
  • نیازمندی‌های سخت‌افزاری و اجرای زنده: هنوز آمار شفافی از میزان دقیق تأخیر زمانی (Latency)، توان پردازش، مصرف حافظه، محدودیت‌های کانتکست و سخت‌افزارهای لازم برای استقرار مدل اعلام نشده است.
  • هزینه سنگین نمونه‌گیری: ثبت رکورد برتر در بنچمارک فیزیک با روش نمونه‌گیری هشت‌تایی به دست آمده که بار پردازشی را نسبت به یک تولید زنده عادی به شدت افزایش می‌دهد.
  • راستی‌آزمایی در دنیای واقعی: ادعاهای مربوط به عملکرد بازوهای رباتیک، انسان‌نماها و خودروها به تکرار مستقل در آزمایشگاه‌ها، آزمایش‌های طولانی‌مدت و ارزیابی‌های دقیق ایمنی نیاز دارند.

برگ برنده ادیسه: استفاده دوباره از دانش بصری جهان

پیشنهاد اصلی Odyssey-3 برای توسعه‌دهندگان، روی قابلیت استفاده مجدد تمرکز دارد: ابتدا پویایی‌های بصری جهان را با حجم عظیمی از داده‌های ویدیویی و شبیه‌سازی پیش‌آموزش دهید، ستون فقرات مدل را قفل کنید و سپس برای هر ربات، خودرو یا ایجنت فقط یک رمزگشای سبک بسازید. اگر ارزیابی‌های مستقل نتایج اعلام‌شده را تأیید کنند، این رویکرد می‌تواند نیاز به جمع‌آوری داده‌های اختصاصی را به شدت کاهش داده و مسیر ساخت یک سیستم کنترلی کاربردی از روی یک مدل بینایی ماشین عمومی را کوتاه کند.

پیش‌نمایش در دسترس، دسترسی به API با ثبت درخواست

توسعه‌دهندگان در حال حاضر می‌توانند پیش‌نمایش پژوهشی این مدل را امتحان کنند و برای کنترل سیستم‌های فیزیکی درخواست دسترسی به API ثبت نمایند. از دیگر پروژه‌های مرتبط با این شرکت می‌توان به مدل جهان چندایجنت Agora-2 و فریم‌ورک PROWL-2 اشاره کرد؛ چارچوبی مبتنی بر یادگیری تقویتی که چند ایجنت و مدل جهان آن‌ها را درون یک حلقه مشترک آموزش می‌دهد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد
آخرین اخبار

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد

یک اخترفیزیک‌دان در دانشگاه جانز هاپکینز با استفاده از پلتفرم Claude Science موفق شد یک‌سوم گمشده از نقشه فرابنفش کیهان را بازسازی و کامل کند. این پروژه عظیم که در گذشته به ماه‌ها کار طاقت‌فرسا نیاز داشت، حالا به لطف ایجنت‌های هوشمند کلود و در عرض چند روز به سرانجام رسیده است.

۵ دقیقه مطالعه
۰
۱۷ مهر
سرمایه‌گذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانه‌های هوش مصنوعی شد!
آخرین اخبار

سرمایه‌گذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانه‌های هوش مصنوعی شد!

انویدیا از اختصاص یک میلیارد دلار برای توسعه پژوهش‌های علمی و ابررایانه‌های هوش مصنوعی در آمریکا خبر داد؛ بودجه‌ای که برای این غول تراشه‌ساز حکم پول خرد را دارد اما ارتش پردازشی این کشور را در رقابت با چین تقویت می‌کند. این طرح بلندپروازانه با تجهیز آزمایشگاه‌های ملی به تراشه‌های بلک‌ول، پیشتازی هوش مصنوعی و محاسبات کوانتومی را هدف گرفته است.

۳ دقیقه مطالعه
۰
۱۷ مهر
تاکسی خودران اختصاصی ایکس‌پنگ به خیابان‌ها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تست‌های عمومی
آخرین اخبار

تاکسی خودران اختصاصی ایکس‌پنگ به خیابان‌ها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تست‌های عمومی

شرکت چینی ایکس‌پنگ (XPENG) با معرفی برند جهانی «XPENG YOYO» رسماً وارد فاز آزمایش عمومی تاکسی‌های خودران خود شد. این روبوتاکسی تمام‌عیار با تکیه بر ۴ تراشه هوش مصنوعی تورینگ و مدل پیشرفته بینایی-زبانی VLA 2.0، بدون نیاز به لیدار در خیابان‌ها مسافرگیری می‌کند. کاربران منتخب در چین از همین حالا می‌توانند با کدهای دعوت اختصاصی، سفر در کابین لوکس و هوشمند این تاکسی را تجربه کنند.

۱ دقیقه مطالعه
۰
۱۷ مهر