اول فکر کن بعد حرکت کن؛ شاهکار ساکانا ایآی که شانس موفقیت رباتها را ۳ برابر کرد!
پژوهشگران ساکانا ایآی و دانشگاه توکیو با معرفی روش نوآورانه SAIL نشان دادند که بازوهای رباتیک میتوانند قبل از اجرای واقعی، مسیر حرکت خود را در شبیهساز بسنجند و اصلاح کنند. این رویکرد نرخ موفقیت رباتها را در کارهای ظریف از ۲۵ درصد به ۷۳ درصد میرساند و بدون نیاز به آموزش مجدد مدل، عملکرد خیرهکنندهای ارائه میدهد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- تیم ساکانا ایآی و دانشگاه توکیو سیستمی به اسم SAIL ساختن که به رباتها یاد میده قبل از دست زدن به هر چیزی، مسیر حرکتشون رو تو شبیهساز تست و خطاهای احتمالی رو برطرف کنن.
- با کمک جستجوی درخت مونتکارلو و مدل Gemini Robotics، نرخ موفقیت بازوهای مکانیکی تو انجام مأموریتهای ظریف از ۲۵٪ به رقم چشمگیر ۷۳٪ رسیده.
- بزرگترین برگ برنده این روش اینه که وزنهای مدل هوش مصنوعی دستنخورده میمونه و فقط با صرف پردازش بیشتر حین تصمیمگیری، دقت ربات چند برابر میشه.
جستجوی هوشمندانه SAIL برای طراحی بهترین نقشههای حرکتی ربات
محققان ساکانا ایآی (Sakana AI) و دانشگاه توکیو به دستاورد جذابی رسیدهاند: یک مدل بینایی-زبانی (VLM) ثابت و بدون نیاز به آموزش مجدد، میتواند با جستجو، شبیهسازی و بازبینی مسیرهای کاندید حین استنتاج، حرکات فوقالعاده مطمئنتری برای رباتها بسازد. روش نوآورانه آنها که SAIL نام دارد، میانگین نرخ موفقیت را در ۶ مأموریت جابهجایی شبیهسازیشده، از ۲۵٪ در حالت تکمسیره به ۷۳٪ در حالت بررسی ۴۵ مسیر مختلف رسانده است. این مقاله رسماً در کنفرانس بینالمللی IROS 2026 پذیرفته شده است.
روش SAIL که مخفف عبارت Scaling In-Context Imitation Learning است، راهکاری عالی در اختیار توسعهدهندگان میگذارد تا زمانی که شبیهساز، آرشیوی از نمونههای موفق و بودجه پردازشی کافی دارند، یک برنامهریز کمدقت تکمرحلهای را به سیستمی دقیق تبدیل کنند؛ بدون اینکه نیازی به تغییر یا دستکاری وزنهای اصلی مدل باشد.
چرا اجرای رباتها فقط با یک برنامه حرکتی شکست میخورد؟
در روش یادگیری تقلیدی درونزمینه، ابتدا چند نمونه از کارهای موفق به ربات نشان داده میشود و سپس از مدل خواسته میشود بر اساس همین دموها، یک موقعیت و صحنه جدید را حل کند. مدلهای بینایی-زبانی میتوانند صحنه را برانداز کنند و یک توالی کامل از موقعیت دست، جهتگیری و دستورات باز و بسته شدن گریپر ربات بسازند. با این حال، کوچکترین تغییر در جایگذاری وسایل، دادههای نمونهبرداریشده یا دموهای بازیابیشده میتواند تفاوتهای بزرگی در اجرای واقعی رقم بزند.
گاهی اوقات یک خطای میلیمتری ساده در گرفتن یک جسم، کل مراحل بعدی حرکت را نقش بر آب میکند! اینجاست که SAIL وارد میدان میشود و تکنیک معروف «مقیاسپذیری زمان استنتاج» (Test-Time Scaling) — یعنی مصرف پردازش بیشتر برای هر ورودی در عین ثابت نگه داشتن پارامترهای مدل — را روی مسیرهای حرکتی دنیای فیزیکی پیاده میکند. این سیستم ابتدا چندین برنامه حرکتی میسازد، اجرای آنها را در شبیهساز ارزیابی میکند و با نتایج بهدستآمده، گزینههای امیدوارکننده را اصلاح و بهینهسازی میکند.
نگاهی به درون حلقه جستجوی SAIL
سیستم SAIL مدل زبانی-بینایی Gemini Robotics-ER 1.5 را درون یک جستجوی درخت مونتکارلو (MCTS) قرار میدهد. این مدل همزمان در نقش سازنده مسیر و ارزیاب آن عمل میکند. در این درخت، هر گره (Node) شامل یک مسیر کامل حرکتی است و هر یال (Edge) نشاندهنده یک مرحله اصلاح و بازنگری است. الگوریتم میتواند شاخههای جدید را کاوش کند و بخشهایی را که امتیاز بالاتری گرفتهاند بیشتر توسعه دهد.
- بازیابی و تولید مسیر اولیه: سیستم ابتدا آرشیوی از مسیرهای موفق قبلی را برای صحنههایی که چیدمان اشیای آنها شبیه سناریوی فعلی است جستجو میکند. مدل با دریافت این دموها، تصویر صحنه حاضر و وضعیت ربات، یک مسیر حرکتی کامل و پیشنهادی تولید میکند.
- شبیهسازی و امتیازدهی: یک شبیهساز مسیر پیشنهادی را اجرا کرده و ویدیوی آن را ذخیره میکند. بخش ارزیاب میزان پیشرفت کار را بر اساس زیرمأموریتهای از پیش تعیینشده میسنجد و آن را به یک امتیاز عددی تبدیل میکند. به این ترتیب، میزان پیشرفت مقطعی به سیستم کمک میکند تفاوت بین دو کاندید شکستخورده را هم متوجه شود. ساختار امتیازدهی از سیستم ROVER الهام گرفته شده که تکمیل وظایف را در طول زمان دنبال میکند.
- هماهنگسازی بازخورد با نقاط حرکتی: امتیازهای گرفتهشده از فریمهای ویدیویی، مجدداً به گامهای مشخص در مسیر حرکتی نگاشت میشوند. بخش تولیدکننده این بازخورد مرحلهبهمرحله را دریافت کرده و بخشهایی را که کار در آنها گیر کرده اصلاح میکند؛ در حالی که بخشهای موفق حرکت کاملاً دستنخورده حفظ میشوند.
- انتخاب نهایی برای اجرا: تمام تست و خطای کاندیدها درون محیط شبیهساز انجام میشود. بازوی ربات فیزیکی تنها زمانی حرکت میکند که جستجو کاملاً تمام شده و بهترین مسیر نهایی انتخاب شده باشد.
توسعهدهندگان برای استفاده از این سیستم باید آرشیو نمونههای نمایشی، شبیهساز، خط لوله بازسازی صحنه و معیارهای ارزیابی زیرمأموریتها را آماده کنند. SAIL چهارچوب جستجو و بازنگری را دور تمام این قطعات فراهم میکند.
گرههای بیشتر، برنامههای موفقتر
پژوهشگران این سیستم را روی ۶ مأموریت مختلف در شبیهساز ALOHA و با ۲۰ چیدمان اولیه برای هر مأموریت محک زدند. این آزمونها کارهایی مثل برداشتن موز، باز کردن در خودکار، جابهجا کردن کاسه، باز کردن کشو، بستن لپتاپ و برداشتن ماژیک را شامل میشدند.
روش | تعداد گرههای جستجو | میانگین موفقیت |
|---|---|---|
تولید تکی (معمولی) | ۱ | ۲۵٪ |
جستجوی اول سطح (BFS) | ۱۵ | ۵۱٪ |
جستجوی اول عمق (DFS) | ۱۵ | ۳۷٪ |
روش SAIL | ۶ | ۵۵٪ |
روش SAIL | ۱۵ | ۶۵٪ |
روش SAIL | ۳۰ | ۷۱٪ |
روش SAIL | ۴۵ | ۷۳٪ |
با بودجه ۱۵ گره جستجو، SAIL به میانگین موفقیت ۶۵ درصدی رسید؛ در حالی که جستجوی اول سطح ۵۱ درصد و جستجوی اول عمق فقط ۳۷ درصد موفق بودند. جالب اینجاست که مأموریت جابهجایی کاسه تنها با ۶ گره به موفقیت ۱۰۰ درصدی رسید و مأموریت برداشتن موز هم به رکورد ۸۰ درصد دست یافت. این نتایج با بودجههای برابر ثابت میکند که ترکیب بازیابی هوشمند و بازخورد دقیق در سطح گامهای حرکتی، تأثیری فراتر از صرفاً تولید چند برنامه تصادفی دارد.
یک بازوی فیزیکی واقعی در ۶ آزمایش عملی
تیم تحقیقاتی برای تست روی سختافزار واقعی، از یک بازوی رباتیک LeRobot SO-101 برای مأموریت انداختن مکعب داخل کاسه استفاده کرد. دوربینهای رنگی و عمقسنج دادههای لازم را برای بازسازی صحنه در محیط شبیهساز فرستادند. SAIL تعداد ۱۵ مسیر کاندید را بررسی کرد، بهترین را برگزید و دستور اجرای آن را به بازوی واقعی صادر کرد.
این پایپلاین جستجو در ۵ تلاش از مجموع ۶ آزمایش به موفقیت کامل رسید. محققان تنها مورد ناموفق را ناشی از خطای تخمین ژست اشیا و تفاوتهای فیزیکی بین شبیهساز و دینامیک تماس در دنیای واقعی میدانند.
نکته جالب اینجاست که یک سیاست تقلیدی جداگانه که روی مسیرهای موفق تولیدشده توسط همین جستجو آموزش دیده بود هم توانست ۵ آزمون از ۶ آزمون را با موفقیت تمام کند. این ترفند هوشمندانه بار پردازشی را به بخش تولید داده و آموزش منتقل میکند و اجازه میدهد ربات بدون اجرای درخت جستجو در هر بار تلاش، با سرعت بالا در محیطهای واقعی مستقر شود.
مسیرهای حرکتی؛ موضوع جدید جستجو در دنیای هوش مصنوعی
نوآوری کلیدی SAIL، پیادهسازی مقیاسپذیری زمان استنتاج روی کل مسیر حرکتی ربات است. الگوریتم جستجو روی حرکات کامل ربات مانور میدهد و امتیازات زمانی بخش ارزیاب دقیقاً مشخص میکنند کدام قسمتها نیاز به اصلاح دارند. این ساختار به مدل پایه اجازه میدهد تا بدون نیاز به آموزش مجدد و صرفاً با صرف پردازش بیشتر هنگام استنتاج، از پس سناریوهایی برآید که در حدس اولش شکست خورده بودند.
آزمایشهای تکهبرداری (Ablation) این مقاله هم بهخوبی ارزش بازیابی دقیق و بازخوردهای ریزدانه را نشان میدهد. در صورت استفاده از بازیابی تصادفی یا بازخوردهای ضعیفتر، نرخ موفقیت با افزایش گرهها متوقف میشود؛ در حالی که پایپلاین کامل SAIL حتی تا ۴۵ گره هم مدام بهتر و قویتر میشود.
این روش کجا به کار میآید و چه محدودیتهایی دارد؟
- کاربردهای مناسب: وظایف جابهجایی روی میز که دارای آرشیو نمونههای مفید هستند، همراه با شبیهسازی که هندسه صحنه و تماسها را به خوبی تقریب بزند و البته زمان کافی برای جستجو پیش از شروع حرکت وجود داشته باشد.
- محدودیت کنترلی: مسیر انتخابشده به صورت حلقه-باز (Open-loop) اجرا میشود؛ یعنی ربات حین حرکت بازخورد بصری آنی دریافت نمیکند. این ویژگی استفاده از روش را برای اجسام متحرک، تماسهای نامطمئن یا کارهایی که نیاز به برنامهریزی مجدد لحظهای دارند محدود میسازد.
- هزینه زیرساختی: هر کاندید نیازمند اجرای شبیهسازی، ارزیابی ویدیویی و احتمالاً یک فراخوانی مجدد مدل برای اصلاح است. افزایش بودجه جستجو موفقیت را بالاتر میبرد اما مصرف پردازش و تأخیر زمانی را هم بیشتر میکند.
- ریسک انتقال به دنیای واقعی (Sim-to-Real): خطاهای تخمین موقعیت، هندسه یا مدلسازی تماس ممکن است باعث شوند برنامهای که در شبیهساز بینقص اجرا شده، روی سختافزار واقعی زمین بخورد.
- محدودیت شواهد آزمایشی: ارزیابی شبیهسازیشده ۶ مأموریت را پوشش داده، در حالی که اعتبارسنجی روی سختافزار فیزیکی فقط روی یک مأموریت با ۶ تلاش انجام شده است.
مقاله و وبسایت این پروژه شامل ویدیوهای اجرای شبیهسازیشده و تستهای فیزیکی هستند. برای تیمهای رباتیکی که در حال حاضر از مدلهای زبانی-بینایی استفاده میکنند، روش SAIL یک معماری عملی و جذاب برای افزودن بازیابی، امتیازدهی شبیهسازمحور و تعمیر گامبهگام مسیرها بدون نیاز به فاینتیون کردن مدل زیربنایی فراهم کرده است.
مطالب مرتبط و پیشنهادی

هوش مصنوعی در برزخ سیاست آمریکا: چرا جمهوریخواهان گاز میدهند و دموکراتها ترمز میکشند؟
دنیای هوش مصنوعی این روزها وارد یک بازی سیاسی خطرناک شده؛ جایی که مرزبندیهای حزبی در واشنگتن، آینده این فناوری را به یک میدان نبرد تبدیل کرده است. در حالی که جمهوریخواهان چراغ سبز پیشروی بیوقفه را نشان میدهند، دموکراتها قصد دارند با وضع قوانین سفتوسخت ترمز این صنعت را بکشند؛ تنشی که میتواند به ضرر کل اکوسیستم هوش مصنوعی تمام شود.

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.