ورود جذاب استارتاپ رانوی به دنیای رباتیک؛ آموزش مهارتهای فیزیکی به رباتها با مدل Praxis-1 و تماشای ویدیو!
استارتاپ رانوی که پیشتر با ابزارهای هوش مصنوعی تولید ویدیو به شهرت رسیده بود، با معرفی مدل Praxis-1 رسماً وارد حوزه رباتیک شد. این مدل با تحلیل گسترده ویدیوهای اینترنتی درک فیزیکی محیط را فرا میگیرد تا رباتها بدون نیاز به ساعتها آموزش طاقتفرسای دستی، کارهای فیزیکی را بهدرستی انجام دهند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ رانوی (Runway) با معرفی مدل Praxis-1 نشان داد که میتوان با تماشای ویدیوهای وب، قوانین فیزیک و نحوه جابهجایی اشیاء را به رباتها آموخت و وابستگی به دادههای پرهزینه کنترل دستی را کم کرد.
- در آزمایشهای اولیه، ربات آموزشدیده با ویدیوهای وب پس از فاینتیونینگ، خطایی شانه به شانه با دادههای اختصاصی ضبطشده توسط اپراتور (تنها با اختلاف ۰.۱ سانتیمتر) به ثبت رساند.
- این مدل قرار است بهصورت وزنهای باز (Open-Weight) عرضه شود تا تیمهای رباتیک بتوانند آن را برای انواع بازوهای مکانیکی و پایههای متحرک شخصیسازی کنند.
ورود پرقدرت رانوی به کنترل رباتها با مدل Praxis-1
استارتاپ رانوی (Runway) که همه ما آن را با ابزارهای پیشرفته تولید ویدیو میشناسیم، حالا نتایج پژوهشهای خود را به دنیای رباتهای فیزیکی آورده است. این شرکت از Praxis-1 رونمایی کرده؛ اولین «مدل اقدام جهان» (World Action Model) با وزنهای باز (Open-Weight) که بر پایه سیستمهای پیشآموزش ویدیویی در مقیاس عظیم توسعه یافته است. در حال حاضر همکاران تجاری اولیه رانوی در حال آزمایش این مدل روی سختافزارهای خود هستند و این استارتاپ وعده داده که وزنهای مدل طی ماههای آینده منتشر میشود؛ هرچند هنوز تاریخ دقیقی برای عرضه عمومی مشخص نکرده است.
مدل پرکسیس-۱ (Praxis-1) مستقیماً به سراغ یکی از بزرگترین چالشهای همیشگی علم رباتیک رفته است: جمعآوری دادههای حرکتی از طریق کنترل از راه دور (Teleoperation) بسیار کُند، طاقتفرسا و پرهزینه است. ایده جذاب رانوی این است که با تماشای ویدیوهای موجود در وب، حرکت، نحوه تعامل با اشیاء و درک فیزیکی محیط را به مدل آموزش دهد و سپس آن را با مقدار کمی داده اختصاصی ربات تنظیم (Fine-tune) کند. این ترفند هوشمندانه میتواند نیاز به نمایشهای عملی بیشمار برای هر بازوی مکانیکی یا سناریوی جدید را به شکل چشمگیری کاهش دهد.
ویدیوهای وب؛ راهکاری برای شکستن بنبست کمبود داده
سیاستهای حرکتی رباتهای همهمنظوره به مثالهای متنوعی از اشیاء، محیطها، زوایای دید و خطاهای احتمالی نیاز دارند. اگرچه کنترل دستی ربات به اپراتور اجازه میدهد حرکات را با برچسبهای دقیق ثبت کند، اما جمعآوری داده کافی برای شرایط خاص و پیشبینینشده حسابی خرج روی دست تیمها میگذارد. در نقطه مقابل، ویدیوهای وب یک گنجینه بصری بینهایت را پیش روی هوش مصنوعی میگذارند؛ حتی اگر دستورات دقیق حرکتی، موقعیت مفاصل یا دادههای سنجش نیروی ربات درون آنها ضبط نشده باشد.
گزارشهای رانوی نشان میدهد هر چه میزان پیشآموزش با ویدیوهای زاویه سوم شخص بیشتر باشد، عملکرد مدل هم ارتقا پیدا میکند. در یکی از جالبترین آزمایشهای جابهجایی و تعیین موقعیت اشیاء، مدل آموزشدیده با ویدیوی وب پس از فاینتیونینگ، خطایی تقریباً یکسان با مدل آموزشدیده با دادههای پرخرج کنترل از راه دور ثبت کرد:
منبع پیشآموزش | خطای نهایی در قرار دادن جسم |
|---|---|
ویدیوهای وب | ۱۶.۱ سانتیمتر |
ویدیوی ضبطشده از ربات با کنترل دستی | ۱۶.۰ سانتیمتر |
اختلاف ناچیز ۰.۱ سانتیمتری نشان میدهد که عملکرد هر دو روش در این آزمایش کاملاً پایاپای بوده است. البته برای رسیدن به یک نتیجهگیری قطعی و کلی، باید منتظر جزئیات بیشتر مثل نوع دقیق تسکها، حجم دیتاستها، میزان نوسان در اجراهای مختلف و ارزیابی داوران مستقل بمانیم؛ مواردی که فعلاً در بیانیه اولیه رانوی اشارهای به آنها نشده است.
یک مدل برای پیشبینی و عمل؛ ادغام مغز و دست ربات
یک مدل جهان (World Model) وظیفه دارد پیشبینی کند که محیط با گذشت زمان یا در پاسخ به یک اقدام خاص چه تغییری میکند. از طرف دیگر، یک مدل خطمشی (Policy Model) دادههای دوربینها و سنسورها را میگیرد و آنها را به فرامین حرکتی قابل اجرا برای ربات تبدیل مینماید. حالا یک «مدل اقدام جهان» دقیقاً این دو قابلیت را ترکیب میکند؛ یعنی با تکیه بر درک عمیق از رفتار فیزیکی اشیاء، هوشمندانهترین حرکت را برای ربات انتخاب میکند.
مدل Praxis-1 بر پایه سیستمهای ویدیویی تعاملی خود رانوی، از جمله Solaris و GWM Worlds 2 ساخته شده است؛ سیستمهایی که وظیفه دارند صحنههای قابلکنترل تولید کنند تا روابط فیزیکی بین اجسام، حرکت و محیط اطراف به واقعیترین شکل ممکن شبیهسازی شود.
البته ویدیوهای بدون برچسب حرکتی یک چالش جدی دارند که در دنیای هوش مصنوعی به آن «مسئله اتصال یا گراندینگ» (Grounding Problem) میگویند. پیکسلهای تصویر نشان میدهند که یک دست لیوان را برمیدارد، اما زاویه مفاصل، نیروی گریپر یا فرکانس کنترل مورد نیاز برای بازتولید آن حرکت را فاش نمیکنند! به همین دلیل، Praxis-1 به یک مرحله تنظیم دقیق با دادههای ربات نیاز دارد تا بتواند مفاهیم تصویری را به فرامین اجرایی تبدیل کند. رانوی هنوز فاش نکرده که این اتصال دقیقاً چگونه انجام میشود یا به چه مقدار داده حرکتی ربات نیاز دارد.
علاوه بر این، رانوی از همبستگی فوقالعاده ۰.۹۵ بین ارزیابی سیاستها در شبیهسازهای تولیدی خود و نتایج واقعی روی رباتهای فیزیکی خبر داده است. اگر این رابطه پایدار باشد، مهندسان میتوانند بدون اشغال مداوم دستگاههای فیزیکی، سیاستهای حرکتی را در شبیهساز تست و غربالگری کنند. البته این عدد همبستگی هنوز دقت مطلق، پایداری در خطاهای نادر یا ایمنی ربات در شرایط پیشبینینشده را تضمین نمیکند.

چهار خوان سخت در مهار و جابهجایی اشیاء
تیم رانوی چالشهای پیشروی سیستمهای یادگیری تقلیدی را به چهار دسته کلیدی تقسیم کرده که رباتها معمولاً در آنها دچار خطا میشوند:
دستهبندی چالش | چالش ربات برای اجرای حرکت |
|---|---|
اجسام صلب و تکراری | تشخیص یک هدف مشخص از میان انبوهی از اجسام تقریباً یکشکل |
محیطهای شلوغ و درهم | درک موقعیت اجسام در صورت پنهان شدن یا همپوشانی آنها با وسایل دیگر |
اجسام شفاف و شیشهای | تخمین درست شکل و عمق جسم در شرایطی که سرنخهای بصری بسیار ضعیف هستند |
اجسام انعطافپذیر و تغییرشکلدهنده | برداشتن و مهار پارچهها و اشیایی که نقطه ثابت و مشخصی برای گرفتن ندارند |
فرضیه اصلی رانوی این است که پیشآموزش گسترده روی ویدیوها، یک درک اولیه عالی درباره شکست نور، تاشدن پارچهها، مرز اشیاء و حرکات محتمل به مدل میدهد؛ دانشی که مدلهای معمولی به دلیل کمبود دادههای ضبطشده، فرصت کمی برای یادگیری آن دارند. با این حال، در این رونمایی نرخ موفقیت در هر بخش یا مقایسه با استانداردهای عمومی منتشر نشده است.
آزمایش اولین نسخهها توسط شرکای تجاری
رانوی قصد دارد پیش از انتشار عمومی وزنهای مدل، نسخه اولیه Praxis-1 را در اختیار شرکای منتخب بگذارد. این استقرار اولیه روی ترکیبهای متنوعی از کالبدهای رباتیک، بازوها، سنسورها و سیستمهای کنترل در حال اجراست:
شریک تجاری | پیکربندی سختافزاری |
|---|---|
شرکت Noble Machines | سیستم جابهجایی و کنترل دو بازویی (Bimanual) |
شرکت Standard Bots | بازوی مکانیکی RO1 با ۶ درجه آزادی |
شرکت Ultra | پایه متحرک رباتیک (Mobile Base) |
نکته جالبتوجه این است که رانوی نشان داده همین مدل حرکتی، بدون هیچ آموزش یا دستکاری اضافهای، هم در یک محیط استودیویی کنترلشده و هم در یک آشپزخانه خانگی واقعی کار میکند. این آزمایش نشاندهنده انتقال موفقیتآمیز میان دو محیط متفاوت (Cross-Environment Transfer) است؛ امری که پیشتر نیازمند فاینتیونینگهای طولانی یا تنظیمات تصادفی در شبیهسازها بود. با این حال، این تستها هنوز در مراحل آغازین هستند و هیچ بنچمارک مستقلی برای اثبات ادعاها منتشر نشده است.

وزنهای باز، اما با مجوزی که هنوز مشخص نیست!
رانوی اعلام کرده که Praxis-1 بهصورت وزنهای باز قابل دانلود عرضه خواهد شد. دسترسی به وزنهای باز به محققان و توسعهدهندگان اجازه میدهد پارامترهای مدل را بررسی کرده، آن را فاینتیون کنند و روی سرورهای خود اجرا نمایند؛ البته همهچیز به مجوزی وابسته است که شرکت در آینده اعلام خواهد کرد. این دسترسی به منزله انتشار کدهای آموزشی، دیتاستها، جزئیات معماری یا استفاده تجاری نامحدود نیست.
اگر این مدل با مجوزی دستودلباز و آزاد منتشر شود، میتواند یک سنگبنای عالی برای تیمهای رباتیک باشد تا بتوانند سیاستهای حرکتی را برای انواع بازوها و پلتفرمهای متحرک شخصیسازی کنند. البته تیمها همچنان به کالیبراسیون دادهها، تستهای ایمنی و لایههای اتصال سنسورها نیاز خواهند داشت. علاوه بر این، رانوی توسعه مدلهای متنباز جهان را بخشی از استراتژی کلان خود برای تقویت پیشرفت ایالات متحده در حوزه «هوش مصنوعی فیزیکی» میداند.
توسعهدهندگان منتظر چه پاسخهایی هستند؟
اطلاعیه فعلی رانوی هنوز ابهامات فنی و اجرایی مهمی را بیپاسخ گذاشته است:
- اندازه دقیق مدل، معماری شبکه، فرمت چکپوینتها و دقت محاسباتی
- سختافزار مورد نیاز برای استنتاج، میزان تاخیر (Latency)، مصرف حافظه و نرخ بهروزرسانی کنترل ربات
- فرمت دادههای ورودی، نحوه نمایش دستورات حرکتی و سنسورهای الزامی
- ترکیب و منشأ دیتاست ویدیوهایی که برای پیشآموزش استفاده شدهاند
- روش دقیق تبدیل ویدیوهای بدون برچسب به دستورات فیزیکی ربات (Action Grounding)
- میزان دیتای ربات برای فاینتیون کردن مدل روی یک بدنه و سختافزار جدید
- پشتیبانی از انواع بازوها، گریپرها، پایههای متحرک و فرآیندهای کالیبراسیون
- مقایسه در بنچمارکهای مطرح با مدلهای معروفی مثل Pi-0، RT-2 و Octo
- محدودیتهای ایمنی، نحوه تشخیص خطا و عملکردهای بازدارنده در شرایط اضطراری
- شرایط مجوز نهایی، حقوق استفاده تجاری و تاریخ دقیق انتشار عمومی
گام بعدی: عرضه عمومی و آزمون سخت تکرارپذیری
مدل Praxis-1 یک ایده جذاب و قابل ارزیابی را به میدان آورده است: اینکه پیشآموزش گسترده با ویدیو میتواند وابستگی رباتیک به دادههای پرهزینه کنترل از راه دور را به حداقل برساند. نتایج آزمایش جابهجایی اشیاء تا حدی این ایده را پشتیبانی میکند، اما تا زمانی که مقاله رسمی، وزنهای مدل و جزئیات بنچمارکها منتشر نشوند، نمیتوان درباره درستی و تکرارپذیری این نتایج قضاوت قطعی کرد.
بدون شک دادههای حرکتی خود رباتها همچنان برای انطباق با سختافزار، ارزیابی دقیق و حفظ ایمنی نقشی حیاتی خواهند داشت. با این حال اگر آزمایشهای مستقل ادعای رانوی را تایید کنند، تیمهای رباتیک میتوانند با تکیه بر ویدیوهای وب، زمان و هزینه راهاندازی رباتهای جدید را به شدت کاهش دهند. در حال حاضر توسعهدهندگان میتوانند برای دریافت دسترسی زودهنگام به این مدل، درخواست خود را برای تیم رباتیک رانوی بفرستند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

خط قرمز کالیفرنیا برای کارفرماها: اخراج کارمندان با هوش مصنوعی رسماً ممنوع شد!
ایالت کالیفرنیا با تصویب یک بسته قانونی تازه، دست کارفرماها را در استفاده بیرویه از هوش مصنوعی بست و اخراج کارکنان صرفاً بر اساس تصمیم الگوریتمها را ممنوع اعلام کرد. این قانون علاوه بر الزام به شفافیت در تعدیلهای نیرو، استفاده از هوش مصنوعی برای نظارت تصویری در سرویسهای بهداشتی محل کار را هم قدغن کرده است. فرماندار کالیفرنیا با دفاع از نیروی کار، ادعای امکان خودتنظیمگری شرکتهای هوش مصنوعی را بیاساس خواند.

طوفان هوش مصنوعی در بازار حافظه؛ رکورد تاریخی درآمد ۵۴ میلیارد دلاری میکرون در یک فصل!
عطش سیریناپذیر غولهای فناوری برای توسعه هوش مصنوعی، درآمد فصلی شرکت میکرون را با جهشی باورنکردنی به بیش از ۵۴ میلیارد دلار رساند تا والاستریت شگفتزده شود. این غول تراشهسازی با ثبت درآمد سالانه ۱۳۳ میلیارد دلاری رکورد تاریخ خود را شکست و حالا با تقاضای انفجاری برای حافظههای پیشرفته، چشم به آیندهای درخشانتر دوخته است.

خداحافظی گوگل با Opal؛ جمزها به «اسکیلهای جمینای» برای تمام کاربران تبدیل میشوند!
گوگل در اقدامی تازه برای یکپارچهسازی ابزارهای هوش مصنوعی، سرویس Opal را بازنشسته کرده و دستیارهای اختصاصی جمز را به «اسکیلهای جمینای» تبدیل میکند. این قابلیت که پیش از این در انحصار کاربران اشتراکی بود، حالا با پیروی از استاندارد مشترک ایجنتها و به کمک دستورهای ساده اسلش، به رایگان در دسترس همه کاربران قرار میگیرد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.