رونمایی از مدل جهان Odyssey-3؛ آموزش قوانین فیزیک به رباتها از دل ویدیو!
استارتاپ Odyssey از مدل جهان پیشرفته Odyssey-3 رونمایی کرد؛ مدلی تعاملی که با تبدیل متن به محیطهای سهبعدی و شبیهسازی دقیق فیزیک، کنترل رباتها و خودروهای خودران را متحول میکند. این سیستم با یک هسته بصری یکپارچه، امکان آموزش رفتارهای پیچیده فیزیکی را بدون نیاز به دادههای پرهزینه فراهم کرده و به صورت پیشنمایش پژوهشی در دسترس قرار گرفته است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ Odyssey از مدل جهان جدید خود با نام Odyssey-3 رونمایی کرد؛ سیستمی تعاملی که با تولید ویدیو و پیشبینی حرکت اجسام، به رباتها و خودروها یاد میدهد چطور در دنیای واقعی عمل کنند.
- این مدل در بنچمارک فیزیک Physics-IQ با ثبت امتیاز ۶۶.۱ توانست رقبای سرشناسی مثل FLUX 3 و NVIDIA Cosmos را پشت سر بگذارد؛ هرچند این رکورد با ترفند انتخاب بهترین خروجی از میان ۸ نمونه به دست آمده است.
- بزرگترین برگ برنده این فناوری، استفاده از یک هسته مشترک برای بازوهای رباتیک، رباتهای انساننما و خودروهای خودران است که نیاز به جمعآوری دادههای پرهزینه را به شدت کاهش میدهد.
پیوند ویدیوهای تعاملی با هدایت فیزیکی در Odyssey-3
استارتاپ Odyssey رسماً از Odyssey-3 رونمایی کرد؛ یک مدل پایه جهان (World Model) که میتواند تنها با یک پرامپت متنی ساده، محیطهایی تعاملی و قابلگشتوگذار بسازد و دقیقاً پیشبینی کند که با حرکات یک انسان یا ایجنت نرمافزاری، صحنه چطور دستخوش تغییر میشود. پیشنمایش پژوهشی و رایگان این مدل هماکنون در دسترس عموم قرار گرفته و توسعهدهندگانی که روی رباتها یا خودروهای خودران کار میکنند، میتوانند برای دسترسی به API اختصاصی آن درخواست دهند.
هسته اصلی Odyssey-3 بر پایه یک «دیفیوژن ترنسفورمر خودبازگشتی» (Autoregressive Diffusion Transformer) ساخته شده است؛ یعنی وضعیتهای بصری را با حذف گامبهگام نویز تولید کرده و سپس هر وضعیت جدید را بر اساس مشاهدات قبلی و دستورات کنترلی تنظیم میکند. تیم Odyssey همین ستون فقرات یا بکبون پیشآموزشدیده را طوری طراحی کرده که همزمان برای سه کاربرد مهم پاسخگو باشد: شبیهسازی تعاملی، کنترل ماشینهای فیزیکی و آموزش ایجنتها. استفاده مجدد از همین ساختار واحد، نیاز به جمعآوری کوهی از دادههای اختصاصی و توان پردازشی سنگین برای هر ربات، خودرو یا محیط شبیهسازی را حسابی کاهش میدهد.
پیشتازی در درک قوانین فیزیک به همراه یک شرط پردازشی مهم
بنچمارک معتبر Physics-IQ Verified بررسی میکند که آیا یک مدل هوش مصنوعی میتواند ویدیوهای آزمایشهای واقعی را طوری ادامه دهد که رفتارهای فیزیکی در دینامیک مایعات، نورشناسی (اپتیک)، مکانیک جامدات، مغناطیس و ترمودینامیک کاملاً حفظ شوند یا نه. بر اساس نتایج منتشرشده در زمان رونمایی، نسخه پیشرفته Odyssey-3 Pro موفق شد بالاترین امتیاز ثبتشده در بخش «ویدیو به ویدیو» را از آن خود کند.
بنچمارک | نتیجه | شرایط و جزئیات ارزیابی |
|---|---|---|
بخش ویدیو به ویدیو در Physics-IQ Verified | ۶۶.۱ | مدل Odyssey-3 Pro با کیفیت 720p و روش نمونهگیری هشتتایی؛ بالاتر از مدل FLUX 3 شرکت Black Forest Labs و نسخههای NVIDIA Cosmos 3. |
بخش تصویر به ویدیو در Physics-IQ Verified | ۵۴.۷ | مدل Odyssey-3 Pro با استفاده از روش نمونهگیری هشتتایی. |
بنچمارک WorldMark (دید اولشخص استایلایز) | رتبه اول | رتبهبندی بر اساس میانگین ۱۳ معیار گزارششده با کپشنهای WorldMark. |
بنچمارک WorldMark (دید سومشخص واقعی و استایلایز) | رتبه اول | مدل Odyssey-3 در هر دو بخش دید سومشخص صدرنشین شد. |
بنچمارک WorldMark (دید اولشخص واقعی) | ۸۰.۶ (رتبه سوم) | پس از مدلهای Lyra 2.0 با امتیاز ۸۴.۴ و AlayaWorld با امتیاز ۸۳.۰. |
البته در این میان یک نکته پردازشی قابلتوجه وجود دارد: امتیاز ۶۶.۱ در بنچمارک Physics-IQ با تکنیک «انتخاب بهترین از میان ۸ خروجی» (Best-of-Eight) به دست آمده که طبیعتاً توان پردازشی به مراتب بیشتری نسبت به یک تولید معمولی میطلبد. هرچند سازندگان مدعی شدهاند که مدل پایه توانسته تعادل بهتری میان دقت فیزیکی و هزینه تولید برقرار کند، اما گزارشهای اولیه بیشتر به نمودارهای مقایسهای بسنده کردهاند و هنوز خبری از قیمتگذاری شفاف API یا میزان تأخیر سختافزاری مشخص نیست.
آموزش رابطه علت و معلول با سه منبع داده مکمل
تیم Odyssey این مدل را با تکیه بر سه منبع دادهای مکمل آموزش داده که هر کدام گوشهای از پازل مدلسازی دنیای تعاملی را تکمیل میکنند:
- ویدیوهای سطح اینترنت: این دادهها گستره وسیعی از جلوههای بصری دنیای واقعی را به همراه برچسبگذاری رویدادها در بازههای زمانی مشخص در اختیار مدل میگذارند.
- ویدیوهای ضبطشده از گیمپلی بازیها: این فریمها دقیقاً با ورودیهای همگام صفحهکلید و ماوس جفت شدهاند تا مدل مستقیماً ببیند هر تصمیم و عمل چه نتیجهای را در صحنه رقم میزند.
- شبیهسازی اجسام صلب (Rigid-body): این شبیهسازیها تعاملات فیزیکی کنترلشده را همراه با توضیحات متنی و متادیتا ارائه میدهند تا یادگیری رابطه علت و معلولی برای هوش مصنوعی به مراتب شفافتر شود.
زیر کاپوت فناوری دیفیوژن آنلاین و بیدرنگ
معماری پایه این سیستم یک دیفیوژن ترنسفورمر ویدیویی چندمرحلهای است که از امبدینگهای موقعیتی چرخشی زمانی (یا همان RoPE) برای کدگذاری ترتیب فریمها بهره میبرد. همچنین سازوکار «پوشش علیتی» (Causal Masking) مانع از آن میشود که مدل فریمهای آینده را ببیند؛ بنابراین سیستم ناچار است وضعیت بعدی صحنه را فقط بر اساس مشاهدات گذشته پیشبینی کند. در طول فرایند آموزش، روش Teacher Forcing مشاهدات درست قبلی را به مدل تزریق میکند و هنگام تولید زنده، مدل از خروجیهای قبلی خودش ادامه میدهد و همزمان دستورات و ورودیهای کنترلی جدید را تحویل میگیرد.
تیم سازنده برای اینکه تأخیر تعاملات به حداقل برسد، نمونهبردار دیفیوژن اصلی را در قالب یک مدل چندمرحلهای بسیار سریع فشرده کرده است. مراحل پسآموزش (Post-training) نیز شامل تقطیر مبتنی بر تطبیق توزیع (که یاد میدهد چطور یک مدل سریعتر همان خروجی مدل کند اولیه را بازتولید کند) در کنار تمایزدهندههای زایای رقابتی (GAN) و یادگیری تقویتی است. البته این استارتاپ هنوز نرخ فریم دقیق، طول کانتکست یا نیازمندیهای سختافزاری لازم برای اجرای این پیشنمایش را به صورت عمومی اعلام نکرده است.
یک مغز متفکر برای سه دنیای فیزیکی متفاوت
استارتاپ Odyssey برای منطبقکردن این ستون فقرات بصری با سیستمهای فیزیکی، آن را کاملاً قفل (Freeze) نگه میدارد و فقط یک پالیسی یا رمزگشای عمل اختصاصی را بر اساس جفت مشاهدات و اقدامات آموزش میدهد. قفلکردن بکبون باعث حفظ وزنهای پیشآموزشدیده میشود و در عین حال، به پالیسی سبکتر اجازه میدهد کنترل دستگاه موردنظر را یاد بگیرد:
- بازوهای رباتیک: طبق گزارش Odyssey، پالیسیهایی که تنها با چند ده ساعت داده نمایشی آموزش دیدهاند، وظایف جابهجایی اشیا را با موفقیت انجام داده و حتی در مواقع بروز خطا (که در دادههای آموزشی نبوده) عملکرد خود را بازیابی کردهاند؛ مثلاً اگر گریپر ربات در گرفتن یک شیء خطا کند، زاویهاش را اصلاح کرده یا جسمی را که در موقعیتی نامتعارف افتاده دوباره برمیدارد.
- رباتهای انساننما: شرکت Flexion پالیسی رباتهای انساننمای خود را بر پایه Odyssey-3 توسعه داده است. این سیستمها در مواجهه با تغییرات محیطی عملکرد به مراتب بهتری نسبت به مدلهای پایهای تصویر-زبان-عمل (VLA) نشان داده و حتی زیر نورهای متغیری که بقیه سیستمها را مختل میکرد، بدون مشکل به کار ادامه دادند.
- خودروهای خودران: تیم سازنده بدون کوچکترین دستکاری در ستون فقرات اصلی، یک پالیسی رانندگی را تنها با ۲۰ ساعت داده رانندگی در جادههای هند آموزش داد. این پالیسی با تکیه بر بازنماییهای بصری مدل، نقاط مسیر (Waypoints) را پیشبینی کرده و به صورت حلقه بسته حرکت میکند؛ به این معنا که هر پیشبینی مستقیماً مشاهده و اقدام بعدی را هدایت میکند.
قفلکردن بکبون اصلی هزینه انطباق را به شدت کاهش میدهد، چرا که هر ساختار فیزیکی به جای یک مدل بصری تازه، فقط به یک پالیسی کوچکتر نیاز دارد. با این حال، شواهد فعلی منحصر به دموها و بنچمارکهای اعلامشده توسط خود Odyssey است و برای اثبات ایمنی و کارایی در ماشینها و محیطهای ناآشنا، به ارزیابیهای مستقل و دقیق نیاز است.
آموزش ایجنتها درون جهانهای شبیهسازیشده
مدل Odyssey-3 در فرایند آموزش ایجنتها نقش محیطی را بازی میکند که مشاهدات را تولید کرده و به اکشنها پاسخ میدهد. در دموی انجام وظایف، یک ایجنت هدفی به زبان طبیعی دریافت میکند، صحنه ساختهشده را زیر نظر میگیرد و تا رسیدن به نتیجه مطلوب، اقدامات متوالی انجام میدهد.
محیطهای تولیدشده توسط هوش مصنوعی میتوانند سناریوهای بیشمار و متنوعی خلق کنند؛ آن هم بدون اینکه نیازی به رباتهای فیزیکی واقعی یا طراحی دستی صحنهها با نرمافزارهای سهبعدی باشد. با این حال، نقطه ضعف ماجرا اینجاست که خطاهای مدل جهان مستقیماً به فرایند آموزش سرایت میکنند؛ یعنی اگر دینامیک صحنه غیرواقعی باشد، حافظه بلندمدت ضعف نشان دهد یا موقعیتهای پیشبینینشده به درستی لحاظ نشوند، ایجنت ممکن است رفتارهای نادرستی بیاموزد. شرکت ادیسه هنوز گزارشی از نرخ موفقیت در انجام وظایف، هزینههای آموزش یا نتایج انتقال از شبیهسازی به دنیای واقعی (Sim-to-Real) برای این سناریو منتشر نکرده است.
ابهامات و نکات مهمی که توسعهدهندگان باید زیر نظر بگیرند
- پایداری در سناریوهای طولانی: معیار سنجش حافظه جهان در بنچمارک WorldMark درون میانگین ۱۳ شاخص ادغام شده و جزئیات دقیقی از اینکه صحنهها تا چه مدت یکپارچگی خود را حفظ میکنند، در دست نیست.
- میزان واقعگرایی در دید اولشخص: مدل Odyssey-3 در بخش دید اولشخص واقعی در بنچمارک WorldMark پس از Lyra 2.0 و AlayaWorld در جایگاه سوم قرار دارد.
- نیازمندیهای سختافزاری و اجرای زنده: هنوز آمار شفافی از میزان دقیق تأخیر زمانی (Latency)، توان پردازش، مصرف حافظه، محدودیتهای کانتکست و سختافزارهای لازم برای استقرار مدل اعلام نشده است.
- هزینه سنگین نمونهگیری: ثبت رکورد برتر در بنچمارک فیزیک با روش نمونهگیری هشتتایی به دست آمده که بار پردازشی را نسبت به یک تولید زنده عادی به شدت افزایش میدهد.
- راستیآزمایی در دنیای واقعی: ادعاهای مربوط به عملکرد بازوهای رباتیک، انساننماها و خودروها به تکرار مستقل در آزمایشگاهها، آزمایشهای طولانیمدت و ارزیابیهای دقیق ایمنی نیاز دارند.
برگ برنده ادیسه: استفاده دوباره از دانش بصری جهان
پیشنهاد اصلی Odyssey-3 برای توسعهدهندگان، روی قابلیت استفاده مجدد تمرکز دارد: ابتدا پویاییهای بصری جهان را با حجم عظیمی از دادههای ویدیویی و شبیهسازی پیشآموزش دهید، ستون فقرات مدل را قفل کنید و سپس برای هر ربات، خودرو یا ایجنت فقط یک رمزگشای سبک بسازید. اگر ارزیابیهای مستقل نتایج اعلامشده را تأیید کنند، این رویکرد میتواند نیاز به جمعآوری دادههای اختصاصی را به شدت کاهش داده و مسیر ساخت یک سیستم کنترلی کاربردی از روی یک مدل بینایی ماشین عمومی را کوتاه کند.
پیشنمایش در دسترس، دسترسی به API با ثبت درخواست
توسعهدهندگان در حال حاضر میتوانند پیشنمایش پژوهشی این مدل را امتحان کنند و برای کنترل سیستمهای فیزیکی درخواست دسترسی به API ثبت نمایند. از دیگر پروژههای مرتبط با این شرکت میتوان به مدل جهان چندایجنت Agora-2 و فریمورک PROWL-2 اشاره کرد؛ چارچوبی مبتنی بر یادگیری تقویتی که چند ایجنت و مدل جهان آنها را درون یک حلقه مشترک آموزش میدهد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد
یک اخترفیزیکدان در دانشگاه جانز هاپکینز با استفاده از پلتفرم Claude Science موفق شد یکسوم گمشده از نقشه فرابنفش کیهان را بازسازی و کامل کند. این پروژه عظیم که در گذشته به ماهها کار طاقتفرسا نیاز داشت، حالا به لطف ایجنتهای هوشمند کلود و در عرض چند روز به سرانجام رسیده است.

سرمایهگذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانههای هوش مصنوعی شد!
انویدیا از اختصاص یک میلیارد دلار برای توسعه پژوهشهای علمی و ابررایانههای هوش مصنوعی در آمریکا خبر داد؛ بودجهای که برای این غول تراشهساز حکم پول خرد را دارد اما ارتش پردازشی این کشور را در رقابت با چین تقویت میکند. این طرح بلندپروازانه با تجهیز آزمایشگاههای ملی به تراشههای بلکول، پیشتازی هوش مصنوعی و محاسبات کوانتومی را هدف گرفته است.

تاکسی خودران اختصاصی ایکسپنگ به خیابانها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تستهای عمومی
شرکت چینی ایکسپنگ (XPENG) با معرفی برند جهانی «XPENG YOYO» رسماً وارد فاز آزمایش عمومی تاکسیهای خودران خود شد. این روبوتاکسی تمامعیار با تکیه بر ۴ تراشه هوش مصنوعی تورینگ و مدل پیشرفته بینایی-زبانی VLA 2.0، بدون نیاز به لیدار در خیابانها مسافرگیری میکند. کاربران منتخب در چین از همین حالا میتوانند با کدهای دعوت اختصاصی، سفر در کابین لوکس و هوشمند این تاکسی را تجربه کنند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.