پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی استارتاپ Reka از هوش مصنوعی همه‌کاره Rho-1: ادغام استدلال، تولید ویدیو و کنترل ربات در یک مغز واحد!

انتشار:۱۳ مهر ۱۴۰۵(۱ ساعت پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ رکا (Reka) با معرفی مدل ۱۹ میلیارد پارامتری Rho-1، تحول بزرگی در هوش مصنوعی چندوجهی رقم زده است؛ مدلی همه‌فن‌حریف که استدلال متنی، ساخت ویدیو و صدور فرامین رباتیک را به‌طور یکپارچه در یک شبکه عصبی واحد ادغام می‌کند. این نوآوری با حذف ارتباطات پراکنده میان چندین مدل تخصصی، مسیر تازه‌ای برای توسعه ابزار‌های تعاملی و ربات‌های هوشمند گشوده است.

رونمایی استارتاپ Reka از هوش مصنوعی همه‌کاره Rho-1: ادغام استدلال، تولید ویدیو و کنترل ربات در یک مغز واحد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ Reka از مدل چندوجهی Rho-1 با ۱۹ میلیارد پارامتر رونمایی کرده که استدلال زبانی، تولید ویدیو و فرامین حرکتی رباتیک را همگی درون یک شبکه عصبی یکپارچه مدیریت می‌کند.
  • با معماری دو جریانه و نسخه سبک‌تر Rho-1 Flash، تعداد گام‌های حذف نویز از ۹۹ مرحله به فقط ۸ مرحله کاهش یافته و قادر است ویدیویی ۵ ثانیه‌ای را تنها در عرض یک ثانیه بسازد.
  • با وجود حذف لایه‌های واسطه میان مدل‌ها، چالش‌هایی مانند واگرایی در ویدیوهای طولانی، رزولوشن محدود ۳۸۴×۶۷۲ و دسترسی اختصاصی در Reka Cloud مانع ورود فوری آن به فاز صنعتی است.

مدل Rho-1؛ همه‌چیز از استدلال و ویدیو تا کنترل ربات در یک مدل واحد

استارتاپ رکا (Reka) از نسخه پیش‌نمایش تحقیقاتی مدل Rho-1 رونمایی کرد؛ یک مدل قدرتمند ۱۹ میلیارد پارامتری که قادر است متن، تصویر، ویدیو و اکشن‌های رباتیک را به‌طور کامل درون یک چک‌پوینت واحد پردازش و تولید کند. کانتکست مشترک این شبکه عصبی باعث می‌شود رسانه‌های تولیدشده، توکن‌های استدلال و سیگنال‌های کنترلی به‌صورت یکپارچه در گام‌های بعدی همان نشست (Session) استفاده شوند و نیازی به پاس‌کاری داده میان مدل‌های جداگانه نباشد.

در حال حاضر بیش‌تر محصولات هوش مصنوعی چندوجهی، ترکیبی از چندین سرویس تخصصی جداگانه هستند؛ برای نمونه یک مدل زبانی برای برنامه‌ریزی، یک مدل دیفیوژن برای ساخت ویدیو، یک شناساگر برای موقعیت‌یابی اشیا و یک مدل خط‌مشی (Policy) برای کنترل ربات دست به دست هم می‌دهند. این مرزبندی‌های سنتی توسعه‌دهندگان را مجبور می‌کند وضعیت‌ها را سریالی کنند، حجم زیادی از دیتا را میان سرویس‌ها جابه‌جا نمایند و تلاش کنند کانتکست را در قالب نمایش‌های ناسازگار حفظ کنند. اما Rho-1 تمام این عملیات پیچیده را به یک فضای توجه (Attention Context) واحد منتقل کرده است.

یک مدل واحد، حافظ کل فرآیند و نشست کاری

واضح‌ترین نمایش این مدل با درخواست کشیدن یک منظره از فانوس دریایی آغاز می‌شود. کاربر در ادامه از Rho-1 می‌خواهد فانوس دریایی را با یک کادر محدودکننده (Bounding Box) مشخص کند، سپس این تصویر را به شکل پرواز نزدیک‌شونده یک پهپاد متحرک سازد، بدون تغییر حرکت دوربین بارش برف را به صحنه بیفزاید و در نهایت تفاوت‌های میان ویدیوهای خروجی را توضیح دهد. تمام این زنجیره پیچیده را فقط یک مدل واحد و بدون از دست دادن وضعیت نشست مدیریت می‌کند.

تیم Reka این معماری را «متقارن» می‌نامد؛ چرا که می‌تواند هر نوع داده و فرمت پشتیبانی‌شده را هم دریافت و هم تولید کند. مدل‌های بینایی-زبانی مرسوم معمولاً تصویر و ویدیو را می‌گیرند اما فقط متن برمی‌گردانند، و از طرف دیگر مدل‌های ساخت ویدیو هم دستورات را صرفاً به پیکسل تبدیل می‌کنند. اما Rho-1 محتوای تولیدشده را درون کانتکست داخلی خود در دسترس نگه می‌دارد تا در مراحل بعدی پردازش استفاده شود؛ قابلیتی که نیاز به انتقال خروجی به مدل‌های خارجی را به‌کل حذف می‌کند.

در این معماری، هر بلوک ترنسفورمر محاسبات را بین دو جریان وزن تخصصی (Expert Streams) با یک عملیات توجه مشترک تقسیم می‌کند:

  • جریان درک و فهم (Understanding Stream): وظیفه پردازش زبان طبیعی، توکن‌های استدلال داخلی و داده‌های بصری را بر عهده دارد و با یک هد پیش‌بینی توکن بعدی (Next-token head)، خروجی‌های گسسته را منتشر می‌کند.
  • جریان تولید (Generation Stream): از یک هد تطبیق جریان (Flow-matching head) برای حذف نویز از نمایش‌های نهفته پیوسته و تبدیل آن‌ها به تصاویر و ویدیوها بهره می‌برد.
  • وضعیت توجه مشترک (Shared Attention State): دستورالعمل‌ها، محتوای بصری قبلی، توکن‌های استدلال و فرامین حرکتی همگی از طریق یک حافظه مشترک KV Cache در دسترس کل شبکه باقی می‌مانند.
  • مسیریابی درونی (Internal Routing): یک توکن ویژه زمانی فعال می‌شود که پاسخ نیازمند تولید تصویر یا ویدیو باشد؛ این توکن به جریان تولید اجازه می‌دهد دقیقاً از همان وضعیت انباشته‌شده به کار خود ادامه دهد.

این مدل اطلاعات را در دو فرمت متفاوت جابه‌جا می‌کند: توکن‌های گسسته وظیفه نمایش متن، استدلال نمادین و دستورات سطح بالا را دارند؛ در حالی که نمایش‌های پیوسته حامل مقادیر نهفته تصویر، فریم‌های ویدیویی، فرامین حرکتی ربات و داده‌های حس عمقی (Proprioception نظیر موقعیت مفاصل و زاویه حرکت اندام‌ها) هستند. حفظ سیگنال‌های فیزیکی به‌صورت مقادیر پیوسته مانع از افت دقتی می‌شود که معمولاً هنگام گسسته‌سازی اجباری این داده‌ها رخ می‌دهد.

کاهش شگفت‌انگیز مراحل نویززدایی از ۹۹ به ۸ در نسخه Flash

استارتاپ Reka سرعت تولید خروجی را برای مدل پایه و یک نسخه تقطیرشده (Distilled) موسوم به Rho-1 Flash به شرح زیر گزارش کرده است:

نسخه مدل
مراحل نویززدایی
عملکرد گزارش‌شده
Rho-1 پایه
۹۹ مرحله
نرخ میانه تولید ۰.۷۹ برابر زمان واقعی (Real-time)، با شروع خروجی استریم پس از حدود ۶ ثانیه
Rho-1 Flash
۸ مرحله
تولید یک ویدیوی ۵.۳ ثانیه‌ای تنها در مدت حدود ۱ ثانیه
ویرایش با Rho-1 Flash
۸ مرحله
رندر مجدد کلیپ‌های حدوداً ۱ ثانیه‌ای در زمانی معادل ۱.۱ ثانیه

رابط استریم این مدل می‌تواند کلیپ‌ها را مستقیماً از وضعیت نهفته قبلی بسط دهد و حین روند تولید، دستورات لحظه‌ای جدید را دریافت کند. به عنوان مثال در یک دموی فیلم‌برداری هوایی، دستورات «گردش به چپ» و «گردش به راست» تنها نیم ثانیه پس از آغاز فرآیند ارسال می‌شوند؛ شاخه‌های ویدیویی تولیدشده فریم‌های آغازین یکسانی دارند اما بلافاصله مسیرهای پروازی متفاوتی را در پیش می‌گیرند.

البته باید به این نکته توجه داشت که این آمار مستقیماً از سوی Reka اعلام شده و هنوز امکان اعتبارسنجی مستقل آن از طریق وزن‌های عمومی یا API رسمی وجود ندارد. پیکربندی سخت‌افزاری، روش بچینگ، تنظیمات خروجی و نوع کامپایل می‌توانند تأثیر چشمگیری روی تأخیر تولید ویدیو بگذارند.

پیوند خوردن فرامین حرکتی ربات با توالی بینایی

توالی پردازشی مشترک این امکان را به Rho-1 می‌دهد که مشاهدات بصری آینده را پیش‌بینی کند و هم‌زمان فرامین حرکتی ربات را از دل همان چک‌پوینت صادر نماید. به این ترتیب، مدل خط‌مشی می‌تواند هم‌گام با دستورات موتور، نمای احتمالی دوربین در لحظات بعدی را هم بسازد و قبل از انجام حرکت، یک پیش‌نمایش بصری از نتیجه کار خود داشته باشد.

در بنچمارک شبیه‌سازی پروژه LIBERO، مدل Rho-1 موفق شد هفت کانال حرکتی مختلف را هم‌زمان با نمای پیش‌بینی‌شده از دوربین مچ ربات تولید کند. این ساختار یکپارچه، مرز میان مدل جهان فیزیکی (World Model) و خط‌مشی کنترلی مجزا را حذف می‌کند؛ هرچند پیش‌نمایش فعلی هنوز اثبات نکرده که این بازده شبیه‌سازی با چه کیفیتی روی ربات‌های واقعی در دنیای فیزیکی پیاده‌سازی می‌شود.

داده‌های آموزشی رباتیک همواره بسیار کمیاب هستند، چرا که ضبط و برچسب‌گذاری مسیرهای حرکتی با هدایت انسانی هزینه‌های سرسام‌آوری دارد. شرکت Reka برای حل این چالش، مدل Rho-1 را با مدل دینامیک معکوس (Inverse-Dynamics Model) خود جفت کرده است؛ مدلی که با تماشای یک ویدیو تخمین می‌زند چه سیگنال‌های کنترلی می‌توانستند چنین حرکتی را رقم بزنند. این روش ویدیوهای بدون برچسب را به داده‌های حرکتی ارزشمند تبدیل می‌کند، گرچه کارایی آن به تناسب دامنه کاری و دقت سیگنال‌های تخمینی وابسته است.

نسخه ارائه‌شده برای نتایج این پژوهش از پایه (From Scratch) با ۳۲۰ پردازنده گرافیکی قدرتمند Nvidia H100 به مدت سه ماه تحت آموزش قرار گرفته است؛ فرآیندی جامع که درک زبانی، فهم بصری، تولید چندرسانه‌ای و کنترل فیزیکی را زیر چتر یک ستون فقرات عصبی واحد جای داد.

دو هدف هم‌زمان و موازی فرآیند یادگیری مدل را به‌روزرسانی می‌کنند:

  • پیش‌بینی توکن بعدی (Next-token prediction): برای آموزش توالی‌های گسسته مانند متون و فرامین نمادین به کار می‌رود.
  • تطبیق جریان (Flow matching): مسئول آموزش تولید پیوسته برای تصاویر، ویدیوها و مسیرهای حرکتی ربات است.

یک ستون فقرات مشترک باعث می‌شود سیگنال‌های یادگیری چندین تسک مختلف، نمایش‌های درونی یکدیگر را ارتقا دهند. ادعای کلیدی پژوهشگران Reka این است که بهبود مهارت‌های استدلال، خلق محتوای ویدیویی و کنترل فیزیکی می‌توانند یکدیگر را تقویت کنند؛ هرچند نسخه پیش‌نمایش فعلی فاقد چک‌پوینت‌های عمومی یا آزمایش‌های حذفی (Ablation Studies) کافی برای سنجش مستقل این ادعاست.

چالش واگرایی و خطای تفکیک؛ سقف توانایی‌های فعلی مدل

تیم توسعه Reka به چندین محدودیت کلیدی اشاره کرده که مانع از کاربرد عملی و تجاری این مدل در مقیاس صنعتی می‌شود:

  • واگرایی در گذر زمان (Long-horizon drift): در یک ویدیوی استریم ۳۰ ثانیه‌ای، مدل بافت‌ها و جزئیات ریز را حفظ می‌کند اما ساختار هندسی اتاق به‌مرور تغییر کرده و شکل نامتعادلی به خود می‌گیرد.
  • لنگرگاه زمانی و ردیابی (Temporal grounding): کادرهای محدودکننده روی تصاویر ثابت عملکرد خوبی دارند، اما در امتداد ویدیو نمی‌توانند اشیا را با اتکای بالا دنبال کنند.
  • پایداری ویرایش (Editing stability): ویرایش‌های هدفمند در برخی پرامپت‌های منتخب عالی عمل می‌کنند، ولی در ورودی‌های متنوع‌تر شکننده هستند.
  • کیفیت و وضوح (Resolution): خروجی ویدیویی نیتیو مدل فعلاً به رزولوشن ۶۷۲ در ۳۸۴ پیکسل محدود شده است.

اگرچه دموهای منتشرشده قدرت ادامه‌دهی بصری تعاملی را به رخ می‌کشند، اما هنوز شبیه‌سازی دقیق و کالیبره‌شده فیزیکی، برنامه‌ریزی بلندمدت مطمئن یا کنترل حلقه بسته ایمن برای ربات‌ها را تضمین نمی‌کنند. علاوه بر این، تجمیع همه‌چیز در یک مدل ریسک خطا را متمرکز می‌کند؛ هر لغزش در وضعیت اشتراکی می‌تواند استدلال، ساخت ویدیو و خروجی حرکتی را به‌طور هم‌زمان مختل سازد.

حذف واسطه‌ها در عین دسترسی محدود و کنترل‌شده

برای توسعه‌دهندگان نرم‌افزار، این معماری می‌تواند مدیریت وضعیت را در حوزه‌های ادیت، تحلیل داده، شبیه‌سازی و کنترل رباتیک بسیار آسان‌تر کند. وقتی هر عملیات به یک کانتکست یکتا رجوع کند، لایه‌های تبدیل فرمت و فراخوانی‌های متعدد شبکه میان مدل‌های گوناگون حذف می‌شوند. با این وجود، استقرار عملیاتی یک مدل ۱۹ میلیارد پارامتری که ویدیو نیز تولید می‌کند، نیازمند حافظه پردازشی فوق‌العاده و زیرساخت بسیار قدرتمندی خواهد بود.

کاربردهای بالقوه چنین فناوری جذابی شامل شبیه‌سازی‌های شاخه‌دار رباتیک، ابزار‌های تعاملی تدوین ویدیو، و مدل‌های خط‌مشی است که قبل از هرگونه حرکت فیزیکی، نتایج بصری آن را پیش‌بینی می‌کنند. البته موفقیت تجاری واقعی آن‌ها در گرو تولید ویدیوهای طولانی‌تر، ردیابی زمانی دقیق‌تر، رزولوشن‌های بالا‌تر و اثبات انطباق با قوانین پویای فیزیک در دنیای واقعی است.

در حال حاضر مدل Rho-1 همچنان در فاز پیش‌نمایش تحقیقاتی قرار دارد و دسترسی به آن صرفاً از طریق همکاری‌های ویژه در بستر سرویس ابری Reka Cloud امکان‌پذیر است. شرکت Reka هنوز وزن‌های عمومی مدل یا API همگانی آن را منتشر نکرده است؛ بنابراین توسعه‌دهندگان فعلاً نمی‌توانند آن را مستقیماً در پروژه‌های خود ادغام کرده یا ادعاهای عملکردی آن را به‌صورت مستقل ارزیابی کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

هوش مصنوعی در نقش خواهر بزرگ‌تر؛ راه‌اندازی استارتاپ Hot Girl Hotline برای مشاوره روابط عاطفی
آخرین اخبار

هوش مصنوعی در نقش خواهر بزرگ‌تر؛ راه‌اندازی استارتاپ Hot Girl Hotline برای مشاوره روابط عاطفی

دو خواهر کارآفرین استارتاپی به نام Hot Girl Hotline راه‌اندازی کرده‌اند که با استفاده از مدل‌های هوش مصنوعی، نقش یک خواهر بزرگ‌تر امین را برای دختران جوان بازی می‌کند و به آن‌ها در روابط عاطفی مشاوره می‌دهد. این پلتفرم برخلاف چت‌بات‌های عمومی، روی پیشگیری از وابستگی روحی و بازگرداندن فرد به زندگی واقعی تمرکز دارد و داده‌های کاربران را هم کاملاً محرمانه نگه می‌دارد.

۴ دقیقه مطالعه
۰
۱۳ مهر
شاید همکار بغل‌دستی‌تان خوره‌ی مخفی هوش مصنوعی باشد؛ چرا کارمندان پرامپت‌های خود را لو نمی‌دهند؟
آخرین اخبار

شاید همکار بغل‌دستی‌تان خوره‌ی مخفی هوش مصنوعی باشد؛ چرا کارمندان پرامپت‌های خود را لو نمی‌دهند؟

شاید همکار بغل‌دستی شما بدون اینکه رو کند، یک نابغه تمام‌عیار در کار با ابزار‌های هوش مصنوعی باشد! گزارش‌های تازه نشان می‌دهد بخش بزرگی از کارمندان، پرامپت‌های جادویی و روش‌های کار با AI را مثل یک راز بزرگ پیش خودشان نگه می‌دارند تا دست بالا را در شرکت داشته باشند. این پنهان‌کاری جالب نه از سر بدجنسی، بلکه ناشی از ترس عمیق کارکنان از بالا رفتن بی‌رویه انتظارات مدیران و رقابت شغلی است.

۳ دقیقه مطالعه
۰
۱۳ مهر
انقلاب ایجنت‌های خوداصلاح‌گر؛ وقتی هوش مصنوعی کدهای خودش را از نو بازنویسی می‌کند!
آخرین اخبار

انقلاب ایجنت‌های خوداصلاح‌گر؛ وقتی هوش مصنوعی کدهای خودش را از نو بازنویسی می‌کند!

تا پیش از این، برنامه‌نویس‌ها ساعت‌ها وقت صرف تنظیم دستی پرامپت‌ها و ابزار‌ها می‌کردند تا ایجنت‌های هوش مصنوعی اندکی بهتر عمل کنند؛ اما حالا ورق برگشته است. پژوهشگران چارچوب‌هایی ابداع کرده‌اند که به ایجنت‌ها امکان می‌دهد با تحلیل خطاهای گذشته، دستورالعمل‌ها و کدهای خود را بازنویسی و ارتقا دهند. این دستاورد مسیر را برای ساخت سیستم‌های خوداصلاح‌گری هموار می‌کند که بدون نیاز به دخالت انسان روزبه‌روز باهوش‌تر می‌شوند.

۳ دقیقه مطالعه
۰
۱۳ مهر