پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ورود جذاب استارتاپ ران‌وی به دنیای رباتیک؛ آموزش مهارت‌های فیزیکی به ربات‌ها با مدل Praxis-1 و تماشای ویدیو!

انتشار:۹ مهر ۱۴۰۵(۲ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ ران‌وی که پیش‌تر با ابزار‌های هوش مصنوعی تولید ویدیو به شهرت رسیده بود، با معرفی مدل Praxis-1 رسماً وارد حوزه رباتیک شد. این مدل با تحلیل گسترده ویدیوهای اینترنتی درک فیزیکی محیط را فرا می‌گیرد تا ربات‌ها بدون نیاز به ساعت‌ها آموزش طاقت‌فرسای دستی، کار‌های فیزیکی را به‌درستی انجام دهند.

ورود جذاب استارتاپ ران‌وی به دنیای رباتیک؛ آموزش مهارت‌های فیزیکی به ربات‌ها با مدل Praxis-1 و تماشای ویدیو!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ ران‌وی (Runway) با معرفی مدل Praxis-1 نشان داد که می‌توان با تماشای ویدیوهای وب، قوانین فیزیک و نحوه جابه‌جایی اشیاء را به ربات‌ها آموخت و وابستگی به داده‌های پرهزینه کنترل دستی را کم کرد.
  • در آزمایش‌های اولیه، ربات آموزش‌دیده با ویدیوهای وب پس از فاین‌تیونینگ، خطایی شانه به شانه با داده‌های اختصاصی ضبط‌شده توسط اپراتور (تنها با اختلاف ۰.۱ سانتی‌متر) به ثبت رساند.
  • این مدل قرار است به‌صورت وزن‌های باز (Open-Weight) عرضه شود تا تیم‌های رباتیک بتوانند آن را برای انواع بازوهای مکانیکی و پایه‌های متحرک شخصی‌سازی کنند.

ورود پرقدرت ران‌وی به کنترل ربات‌ها با مدل Praxis-1

استارتاپ ران‌وی (Runway) که همه ما آن را با ابزار‌های پیشرفته تولید ویدیو می‌شناسیم، حالا نتایج پژوهش‌های خود را به دنیای ربات‌های فیزیکی آورده است. این شرکت از Praxis-1 رونمایی کرده؛ اولین «مدل اقدام جهان» (World Action Model) با وزن‌های باز (Open-Weight) که بر پایه سیستم‌های پیش‌آموزش ویدیویی در مقیاس عظیم توسعه یافته است. در حال حاضر همکاران تجاری اولیه ران‌وی در حال آزمایش این مدل روی سخت‌افزارهای خود هستند و این استارتاپ وعده داده که وزن‌های مدل طی ماه‌های آینده منتشر می‌شود؛ هرچند هنوز تاریخ دقیقی برای عرضه عمومی مشخص نکرده است.

مدل پرکسیس-۱ (Praxis-1) مستقیماً به سراغ یکی از بزرگ‌ترین چالش‌های همیشگی علم رباتیک رفته است: جمع‌آوری داده‌های حرکتی از طریق کنترل از راه دور (Teleoperation) بسیار کُند، طاقت‌فرسا و پرهزینه است. ایده جذاب ران‌وی این است که با تماشای ویدیوهای موجود در وب، حرکت، نحوه تعامل با اشیاء و درک فیزیکی محیط را به مدل آموزش دهد و سپس آن را با مقدار کمی داده اختصاصی ربات تنظیم (Fine-tune) کند. این ترفند هوشمندانه می‌تواند نیاز به نمایش‌های عملی بی‌شمار برای هر بازوی مکانیکی یا سناریوی جدید را به شکل چشمگیری کاهش دهد.

ویدیوهای وب؛ راهکاری برای شکستن بن‌بست کمبود داده

سیاست‌های حرکتی ربات‌های همه‌منظوره به مثال‌های متنوعی از اشیاء، محیط‌ها، زوایای دید و خطاهای احتمالی نیاز دارند. اگرچه کنترل دستی ربات به اپراتور اجازه می‌دهد حرکات را با برچسب‌های دقیق ثبت کند، اما جمع‌آوری داده کافی برای شرایط خاص و پیش‌بینی‌نشده حسابی خرج روی دست تیم‌ها می‌گذارد. در نقطه مقابل، ویدیوهای وب یک گنجینه بصری بی‌نهایت را پیش روی هوش مصنوعی می‌گذارند؛ حتی اگر دستورات دقیق حرکتی، موقعیت مفاصل یا داده‌های سنجش نیروی ربات درون آن‌ها ضبط نشده باشد.

گزارش‌های ران‌وی نشان می‌دهد هر چه میزان پیش‌آموزش با ویدیوهای زاویه سوم شخص بیش‌تر باشد، عملکرد مدل هم ارتقا پیدا می‌کند. در یکی از جالب‌ترین آزمایش‌های جابه‌جایی و تعیین موقعیت اشیاء، مدل آموزش‌دیده با ویدیوی وب پس از فاین‌تیونینگ، خطایی تقریباً یکسان با مدل آموزش‌دیده با داده‌های پرخرج کنترل از راه دور ثبت کرد:

منبع پیش‌آموزش
خطای نهایی در قرار دادن جسم
ویدیوهای وب
۱۶.۱ سانتی‌متر
ویدیوی ضبط‌شده از ربات با کنترل دستی
۱۶.۰ سانتی‌متر

اختلاف ناچیز ۰.۱ سانتی‌متری نشان می‌دهد که عملکرد هر دو روش در این آزمایش کاملاً پایاپای بوده است. البته برای رسیدن به یک نتیجه‌گیری قطعی و کلی، باید منتظر جزئیات بیش‌تر مثل نوع دقیق تسک‌ها، حجم دیتاست‌ها، میزان نوسان در اجراهای مختلف و ارزیابی داوران مستقل بمانیم؛ مواردی که فعلاً در بیانیه اولیه ران‌وی اشاره‌ای به آن‌ها نشده است.

یک مدل برای پیش‌بینی و عمل؛ ادغام مغز و دست ربات

یک مدل جهان (World Model) وظیفه دارد پیش‌بینی کند که محیط با گذشت زمان یا در پاسخ به یک اقدام خاص چه تغییری می‌کند. از طرف دیگر، یک مدل خط‌مشی (Policy Model) داده‌های دوربین‌ها و سنسورها را می‌گیرد و آن‌ها را به فرامین حرکتی قابل اجرا برای ربات تبدیل می‌نماید. حالا یک «مدل اقدام جهان» دقیقاً این دو قابلیت را ترکیب می‌کند؛ یعنی با تکیه بر درک عمیق از رفتار فیزیکی اشیاء، هوشمندانه‌ترین حرکت را برای ربات انتخاب می‌کند.

مدل Praxis-1 بر پایه سیستم‌های ویدیویی تعاملی خود ران‌وی، از جمله Solaris و GWM Worlds 2 ساخته شده است؛ سیستم‌هایی که وظیفه دارند صحنه‌های قابل‌کنترل تولید کنند تا روابط فیزیکی بین اجسام، حرکت و محیط اطراف به واقعی‌ترین شکل ممکن شبیه‌سازی شود.

البته ویدیوهای بدون برچسب حرکتی یک چالش جدی دارند که در دنیای هوش مصنوعی به آن «مسئله اتصال یا گراندینگ» (Grounding Problem) می‌گویند. پیکسل‌های تصویر نشان می‌دهند که یک دست لیوان را برمی‌دارد، اما زاویه مفاصل، نیروی گریپر یا فرکانس کنترل مورد نیاز برای بازتولید آن حرکت را فاش نمی‌کنند! به همین دلیل، Praxis-1 به یک مرحله تنظیم دقیق با داده‌های ربات نیاز دارد تا بتواند مفاهیم تصویری را به فرامین اجرایی تبدیل کند. ران‌وی هنوز فاش نکرده که این اتصال دقیقاً چگونه انجام می‌شود یا به چه مقدار داده حرکتی ربات نیاز دارد.

علاوه بر این، ران‌وی از همبستگی فوق‌العاده ۰.۹۵ بین ارزیابی سیاست‌ها در شبیه‌سازهای تولیدی خود و نتایج واقعی روی ربات‌های فیزیکی خبر داده است. اگر این رابطه پایدار باشد، مهندسان می‌توانند بدون اشغال مداوم دستگاه‌های فیزیکی، سیاست‌های حرکتی را در شبیه‌ساز تست و غربالگری کنند. البته این عدد همبستگی هنوز دقت مطلق، پایداری در خطاهای نادر یا ایمنی ربات در شرایط پیش‌بینی‌نشده را تضمین نمی‌کند.

سکو و بازوی دوگانه ربات به همراه دوربین‌ها و کیسه برزنتی روی میز
ستاپ رباتیک دو بازویی که در دموی مدل Praxis-1 ران‌وی مورد استفاده قرار گرفت.

چهار خوان سخت در مهار و جابه‌جایی اشیاء

تیم ران‌وی چالش‌های پیش‌روی سیستم‌های یادگیری تقلیدی را به چهار دسته کلیدی تقسیم کرده که ربات‌ها معمولاً در آن‌ها دچار خطا می‌شوند:

دسته‌بندی چالش
چالش ربات برای اجرای حرکت
اجسام صلب و تکراری
تشخیص یک هدف مشخص از میان انبوهی از اجسام تقریباً یک‌شکل
محیط‌های شلوغ و درهم
درک موقعیت اجسام در صورت پنهان شدن یا هم‌پوشانی آن‌ها با وسایل دیگر
اجسام شفاف و شیشه‌ای
تخمین درست شکل و عمق جسم در شرایطی که سرنخ‌های بصری بسیار ضعیف هستند
اجسام انعطاف‌پذیر و تغییرشکل‌دهنده
برداشتن و مهار پارچه‌ها و اشیایی که نقطه ثابت و مشخصی برای گرفتن ندارند

فرضیه اصلی ران‌وی این است که پیش‌آموزش گسترده روی ویدیوها، یک درک اولیه عالی درباره شکست نور، تاشدن پارچه‌ها، مرز اشیاء و حرکات محتمل به مدل می‌دهد؛ دانشی که مدل‌های معمولی به دلیل کمبود داده‌های ضبط‌شده، فرصت کمی برای یادگیری آن دارند. با این حال، در این رونمایی نرخ موفقیت در هر بخش یا مقایسه با استانداردهای عمومی منتشر نشده است.

آزمایش اولین نسخه‌ها توسط شرکای تجاری

ران‌وی قصد دارد پیش از انتشار عمومی وزن‌های مدل، نسخه اولیه Praxis-1 را در اختیار شرکای منتخب بگذارد. این استقرار اولیه روی ترکیب‌های متنوعی از کالبدهای رباتیک، بازوها، سنسورها و سیستم‌های کنترل در حال اجراست:

شریک تجاری
پیکربندی سخت‌افزاری
شرکت Noble Machines
سیستم جابه‌جایی و کنترل دو بازویی (Bimanual)
شرکت Standard Bots
بازوی مکانیکی RO1 با ۶ درجه آزادی
شرکت Ultra
پایه متحرک رباتیک (Mobile Base)

نکته جالب‌توجه این است که ران‌وی نشان داده همین مدل حرکتی، بدون هیچ آموزش یا دستکاری اضافه‌ای، هم در یک محیط استودیویی کنترل‌شده و هم در یک آشپزخانه خانگی واقعی کار می‌کند. این آزمایش نشان‌دهنده انتقال موفقیت‌آمیز میان دو محیط متفاوت (Cross-Environment Transfer) است؛ امری که پیش‌تر نیازمند فاین‌تیونینگ‌های طولانی یا تنظیمات تصادفی در شبیه‌سازها بود. با این حال، این تست‌ها هنوز در مراحل آغازین هستند و هیچ بنچمارک مستقلی برای اثبات ادعاها منتشر نشده است.

بازوی ربات در حال دست زدن به میوه روی کانتر آشپزخانه
دموی نحوه کارکرد مدل Praxis-1 ران‌وی در محیط یک آشپزخانه واقعی خانگی.

وزن‌های باز، اما با مجوزی که هنوز مشخص نیست!

ران‌وی اعلام کرده که Praxis-1 به‌صورت وزن‌های باز قابل دانلود عرضه خواهد شد. دسترسی به وزن‌های باز به محققان و توسعه‌دهندگان اجازه می‌دهد پارامترهای مدل را بررسی کرده، آن را فاین‌تیون کنند و روی سرور‌های خود اجرا نمایند؛ البته همه‌چیز به مجوزی وابسته است که شرکت در آینده اعلام خواهد کرد. این دسترسی به منزله انتشار کدهای آموزشی، دیتاست‌ها، جزئیات معماری یا استفاده تجاری نامحدود نیست.

اگر این مدل با مجوزی دست‌ودلباز و آزاد منتشر شود، می‌تواند یک سنگ‌بنای عالی برای تیم‌های رباتیک باشد تا بتوانند سیاست‌های حرکتی را برای انواع بازوها و پلتفرم‌های متحرک شخصی‌سازی کنند. البته تیم‌ها همچنان به کالیبراسیون داده‌ها، تست‌های ایمنی و لایه‌های اتصال سنسورها نیاز خواهند داشت. علاوه بر این، ران‌وی توسعه مدل‌های متن‌باز جهان را بخشی از استراتژی کلان خود برای تقویت پیشرفت ایالات متحده در حوزه «هوش مصنوعی فیزیکی» می‌داند.

توسعه‌دهندگان منتظر چه پاسخ‌هایی هستند؟

اطلاعیه فعلی ران‌وی هنوز ابهامات فنی و اجرایی مهمی را بی‌پاسخ گذاشته است:

  • اندازه دقیق مدل، معماری شبکه، فرمت چک‌پوینت‌ها و دقت محاسباتی
  • سخت‌افزار مورد نیاز برای استنتاج، میزان تاخیر (Latency)، مصرف حافظه و نرخ به‌روزرسانی کنترل ربات
  • فرمت داده‌های ورودی، نحوه نمایش دستورات حرکتی و سنسورهای الزامی
  • ترکیب و منشأ دیتاست ویدیوهایی که برای پیش‌آموزش استفاده شده‌اند
  • روش دقیق تبدیل ویدیوهای بدون برچسب به دستورات فیزیکی ربات (Action Grounding)
  • میزان دیتای ربات برای فاین‌تیون کردن مدل روی یک بدنه و سخت‌افزار جدید
  • پشتیبانی از انواع بازوها، گریپرها، پایه‌های متحرک و فرآیندهای کالیبراسیون
  • مقایسه در بنچمارک‌های مطرح با مدل‌های معروفی مثل Pi-0، RT-2 و Octo
  • محدودیت‌های ایمنی، نحوه تشخیص خطا و عملکردهای بازدارنده در شرایط اضطراری
  • شرایط مجوز نهایی، حقوق استفاده تجاری و تاریخ دقیق انتشار عمومی

گام بعدی: عرضه عمومی و آزمون سخت تکرارپذیری

مدل Praxis-1 یک ایده جذاب و قابل ارزیابی را به میدان آورده است: اینکه پیش‌آموزش گسترده با ویدیو می‌تواند وابستگی رباتیک به داده‌های پرهزینه کنترل از راه دور را به حداقل برساند. نتایج آزمایش جابه‌جایی اشیاء تا حدی این ایده را پشتیبانی می‌کند، اما تا زمانی که مقاله رسمی، وزن‌های مدل و جزئیات بنچمارک‌ها منتشر نشوند، نمی‌توان درباره درستی و تکرارپذیری این نتایج قضاوت قطعی کرد.

بدون شک داده‌های حرکتی خود ربات‌ها همچنان برای انطباق با سخت‌افزار، ارزیابی دقیق و حفظ ایمنی نقشی حیاتی خواهند داشت. با این حال اگر آزمایش‌های مستقل ادعای ران‌وی را تایید کنند، تیم‌های رباتیک می‌توانند با تکیه بر ویدیوهای وب، زمان و هزینه راه‌اندازی ربات‌های جدید را به شدت کاهش دهند. در حال حاضر توسعه‌دهندگان می‌توانند برای دریافت دسترسی زودهنگام به این مدل، درخواست خود را برای تیم رباتیک ران‌وی بفرستند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

خط قرمز کالیفرنیا برای کارفرماها: اخراج کارمندان با هوش مصنوعی رسماً ممنوع شد!
آخرین اخبار

خط قرمز کالیفرنیا برای کارفرماها: اخراج کارمندان با هوش مصنوعی رسماً ممنوع شد!

ایالت کالیفرنیا با تصویب یک بسته قانونی تازه، دست کارفرماها را در استفاده بی‌رویه از هوش مصنوعی بست و اخراج کارکنان صرفاً بر اساس تصمیم الگوریتم‌ها را ممنوع اعلام کرد. این قانون علاوه بر الزام به شفافیت در تعدیل‌های نیرو، استفاده از هوش مصنوعی برای نظارت تصویری در سرویس‌های بهداشتی محل کار را هم قدغن کرده است. فرماندار کالیفرنیا با دفاع از نیروی کار، ادعای امکان خودتنظیم‌گری شرکت‌های هوش مصنوعی را بی‌اساس خواند.

۲ دقیقه مطالعه
۰
۹ مهر
طوفان هوش مصنوعی در بازار حافظه؛ رکورد تاریخی درآمد ۵۴ میلیارد دلاری میکرون در یک فصل!
آخرین اخبار

طوفان هوش مصنوعی در بازار حافظه؛ رکورد تاریخی درآمد ۵۴ میلیارد دلاری میکرون در یک فصل!

عطش سیری‌ناپذیر غول‌های فناوری برای توسعه هوش مصنوعی، درآمد فصلی شرکت میکرون را با جهشی باورنکردنی به بیش از ۵۴ میلیارد دلار رساند تا وال‌استریت شگفت‌زده شود. این غول تراشه‌سازی با ثبت درآمد سالانه ۱۳۳ میلیارد دلاری رکورد تاریخ خود را شکست و حالا با تقاضای انفجاری برای حافظه‌های پیشرفته، چشم به آینده‌ای درخشان‌تر دوخته است.

۲ دقیقه مطالعه
۰
۹ مهر
خداحافظی گوگل با Opal؛ جمزها به «اسکیل‌های جمینای» برای تمام کاربران تبدیل می‌شوند!
آخرین اخبار

خداحافظی گوگل با Opal؛ جمزها به «اسکیل‌های جمینای» برای تمام کاربران تبدیل می‌شوند!

گوگل در اقدامی تازه برای یکپارچه‌سازی ابزار‌های هوش مصنوعی، سرویس Opal را بازنشسته کرده و دستیارهای اختصاصی جمز را به «اسکیل‌های جمینای» تبدیل می‌کند. این قابلیت که پیش از این در انحصار کاربران اشتراکی بود، حالا با پیروی از استاندارد مشترک ایجنت‌ها و به کمک دستورهای ساده اسلش، به رایگان در دسترس همه کاربران قرار می‌گیرد.

۴ دقیقه مطالعه
۰
۹ مهر