رونمایی استارتاپ Reka از هوش مصنوعی همهکاره Rho-1: ادغام استدلال، تولید ویدیو و کنترل ربات در یک مغز واحد!
استارتاپ رکا (Reka) با معرفی مدل ۱۹ میلیارد پارامتری Rho-1، تحول بزرگی در هوش مصنوعی چندوجهی رقم زده است؛ مدلی همهفنحریف که استدلال متنی، ساخت ویدیو و صدور فرامین رباتیک را بهطور یکپارچه در یک شبکه عصبی واحد ادغام میکند. این نوآوری با حذف ارتباطات پراکنده میان چندین مدل تخصصی، مسیر تازهای برای توسعه ابزارهای تعاملی و رباتهای هوشمند گشوده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ Reka از مدل چندوجهی Rho-1 با ۱۹ میلیارد پارامتر رونمایی کرده که استدلال زبانی، تولید ویدیو و فرامین حرکتی رباتیک را همگی درون یک شبکه عصبی یکپارچه مدیریت میکند.
- با معماری دو جریانه و نسخه سبکتر Rho-1 Flash، تعداد گامهای حذف نویز از ۹۹ مرحله به فقط ۸ مرحله کاهش یافته و قادر است ویدیویی ۵ ثانیهای را تنها در عرض یک ثانیه بسازد.
- با وجود حذف لایههای واسطه میان مدلها، چالشهایی مانند واگرایی در ویدیوهای طولانی، رزولوشن محدود ۳۸۴×۶۷۲ و دسترسی اختصاصی در Reka Cloud مانع ورود فوری آن به فاز صنعتی است.
مدل Rho-1؛ همهچیز از استدلال و ویدیو تا کنترل ربات در یک مدل واحد
استارتاپ رکا (Reka) از نسخه پیشنمایش تحقیقاتی مدل Rho-1 رونمایی کرد؛ یک مدل قدرتمند ۱۹ میلیارد پارامتری که قادر است متن، تصویر، ویدیو و اکشنهای رباتیک را بهطور کامل درون یک چکپوینت واحد پردازش و تولید کند. کانتکست مشترک این شبکه عصبی باعث میشود رسانههای تولیدشده، توکنهای استدلال و سیگنالهای کنترلی بهصورت یکپارچه در گامهای بعدی همان نشست (Session) استفاده شوند و نیازی به پاسکاری داده میان مدلهای جداگانه نباشد.
در حال حاضر بیشتر محصولات هوش مصنوعی چندوجهی، ترکیبی از چندین سرویس تخصصی جداگانه هستند؛ برای نمونه یک مدل زبانی برای برنامهریزی، یک مدل دیفیوژن برای ساخت ویدیو، یک شناساگر برای موقعیتیابی اشیا و یک مدل خطمشی (Policy) برای کنترل ربات دست به دست هم میدهند. این مرزبندیهای سنتی توسعهدهندگان را مجبور میکند وضعیتها را سریالی کنند، حجم زیادی از دیتا را میان سرویسها جابهجا نمایند و تلاش کنند کانتکست را در قالب نمایشهای ناسازگار حفظ کنند. اما Rho-1 تمام این عملیات پیچیده را به یک فضای توجه (Attention Context) واحد منتقل کرده است.
یک مدل واحد، حافظ کل فرآیند و نشست کاری
واضحترین نمایش این مدل با درخواست کشیدن یک منظره از فانوس دریایی آغاز میشود. کاربر در ادامه از Rho-1 میخواهد فانوس دریایی را با یک کادر محدودکننده (Bounding Box) مشخص کند، سپس این تصویر را به شکل پرواز نزدیکشونده یک پهپاد متحرک سازد، بدون تغییر حرکت دوربین بارش برف را به صحنه بیفزاید و در نهایت تفاوتهای میان ویدیوهای خروجی را توضیح دهد. تمام این زنجیره پیچیده را فقط یک مدل واحد و بدون از دست دادن وضعیت نشست مدیریت میکند.
تیم Reka این معماری را «متقارن» مینامد؛ چرا که میتواند هر نوع داده و فرمت پشتیبانیشده را هم دریافت و هم تولید کند. مدلهای بینایی-زبانی مرسوم معمولاً تصویر و ویدیو را میگیرند اما فقط متن برمیگردانند، و از طرف دیگر مدلهای ساخت ویدیو هم دستورات را صرفاً به پیکسل تبدیل میکنند. اما Rho-1 محتوای تولیدشده را درون کانتکست داخلی خود در دسترس نگه میدارد تا در مراحل بعدی پردازش استفاده شود؛ قابلیتی که نیاز به انتقال خروجی به مدلهای خارجی را بهکل حذف میکند.
در این معماری، هر بلوک ترنسفورمر محاسبات را بین دو جریان وزن تخصصی (Expert Streams) با یک عملیات توجه مشترک تقسیم میکند:
- جریان درک و فهم (Understanding Stream): وظیفه پردازش زبان طبیعی، توکنهای استدلال داخلی و دادههای بصری را بر عهده دارد و با یک هد پیشبینی توکن بعدی (Next-token head)، خروجیهای گسسته را منتشر میکند.
- جریان تولید (Generation Stream): از یک هد تطبیق جریان (Flow-matching head) برای حذف نویز از نمایشهای نهفته پیوسته و تبدیل آنها به تصاویر و ویدیوها بهره میبرد.
- وضعیت توجه مشترک (Shared Attention State): دستورالعملها، محتوای بصری قبلی، توکنهای استدلال و فرامین حرکتی همگی از طریق یک حافظه مشترک KV Cache در دسترس کل شبکه باقی میمانند.
- مسیریابی درونی (Internal Routing): یک توکن ویژه زمانی فعال میشود که پاسخ نیازمند تولید تصویر یا ویدیو باشد؛ این توکن به جریان تولید اجازه میدهد دقیقاً از همان وضعیت انباشتهشده به کار خود ادامه دهد.
این مدل اطلاعات را در دو فرمت متفاوت جابهجا میکند: توکنهای گسسته وظیفه نمایش متن، استدلال نمادین و دستورات سطح بالا را دارند؛ در حالی که نمایشهای پیوسته حامل مقادیر نهفته تصویر، فریمهای ویدیویی، فرامین حرکتی ربات و دادههای حس عمقی (Proprioception نظیر موقعیت مفاصل و زاویه حرکت اندامها) هستند. حفظ سیگنالهای فیزیکی بهصورت مقادیر پیوسته مانع از افت دقتی میشود که معمولاً هنگام گسستهسازی اجباری این دادهها رخ میدهد.
کاهش شگفتانگیز مراحل نویززدایی از ۹۹ به ۸ در نسخه Flash
استارتاپ Reka سرعت تولید خروجی را برای مدل پایه و یک نسخه تقطیرشده (Distilled) موسوم به Rho-1 Flash به شرح زیر گزارش کرده است:
نسخه مدل | مراحل نویززدایی | عملکرد گزارششده |
|---|---|---|
Rho-1 پایه | ۹۹ مرحله | نرخ میانه تولید ۰.۷۹ برابر زمان واقعی (Real-time)، با شروع خروجی استریم پس از حدود ۶ ثانیه |
Rho-1 Flash | ۸ مرحله | تولید یک ویدیوی ۵.۳ ثانیهای تنها در مدت حدود ۱ ثانیه |
ویرایش با Rho-1 Flash | ۸ مرحله | رندر مجدد کلیپهای حدوداً ۱ ثانیهای در زمانی معادل ۱.۱ ثانیه |
رابط استریم این مدل میتواند کلیپها را مستقیماً از وضعیت نهفته قبلی بسط دهد و حین روند تولید، دستورات لحظهای جدید را دریافت کند. به عنوان مثال در یک دموی فیلمبرداری هوایی، دستورات «گردش به چپ» و «گردش به راست» تنها نیم ثانیه پس از آغاز فرآیند ارسال میشوند؛ شاخههای ویدیویی تولیدشده فریمهای آغازین یکسانی دارند اما بلافاصله مسیرهای پروازی متفاوتی را در پیش میگیرند.
البته باید به این نکته توجه داشت که این آمار مستقیماً از سوی Reka اعلام شده و هنوز امکان اعتبارسنجی مستقل آن از طریق وزنهای عمومی یا API رسمی وجود ندارد. پیکربندی سختافزاری، روش بچینگ، تنظیمات خروجی و نوع کامپایل میتوانند تأثیر چشمگیری روی تأخیر تولید ویدیو بگذارند.
پیوند خوردن فرامین حرکتی ربات با توالی بینایی
توالی پردازشی مشترک این امکان را به Rho-1 میدهد که مشاهدات بصری آینده را پیشبینی کند و همزمان فرامین حرکتی ربات را از دل همان چکپوینت صادر نماید. به این ترتیب، مدل خطمشی میتواند همگام با دستورات موتور، نمای احتمالی دوربین در لحظات بعدی را هم بسازد و قبل از انجام حرکت، یک پیشنمایش بصری از نتیجه کار خود داشته باشد.
در بنچمارک شبیهسازی پروژه LIBERO، مدل Rho-1 موفق شد هفت کانال حرکتی مختلف را همزمان با نمای پیشبینیشده از دوربین مچ ربات تولید کند. این ساختار یکپارچه، مرز میان مدل جهان فیزیکی (World Model) و خطمشی کنترلی مجزا را حذف میکند؛ هرچند پیشنمایش فعلی هنوز اثبات نکرده که این بازده شبیهسازی با چه کیفیتی روی رباتهای واقعی در دنیای فیزیکی پیادهسازی میشود.
دادههای آموزشی رباتیک همواره بسیار کمیاب هستند، چرا که ضبط و برچسبگذاری مسیرهای حرکتی با هدایت انسانی هزینههای سرسامآوری دارد. شرکت Reka برای حل این چالش، مدل Rho-1 را با مدل دینامیک معکوس (Inverse-Dynamics Model) خود جفت کرده است؛ مدلی که با تماشای یک ویدیو تخمین میزند چه سیگنالهای کنترلی میتوانستند چنین حرکتی را رقم بزنند. این روش ویدیوهای بدون برچسب را به دادههای حرکتی ارزشمند تبدیل میکند، گرچه کارایی آن به تناسب دامنه کاری و دقت سیگنالهای تخمینی وابسته است.
نسخه ارائهشده برای نتایج این پژوهش از پایه (From Scratch) با ۳۲۰ پردازنده گرافیکی قدرتمند Nvidia H100 به مدت سه ماه تحت آموزش قرار گرفته است؛ فرآیندی جامع که درک زبانی، فهم بصری، تولید چندرسانهای و کنترل فیزیکی را زیر چتر یک ستون فقرات عصبی واحد جای داد.
دو هدف همزمان و موازی فرآیند یادگیری مدل را بهروزرسانی میکنند:
- پیشبینی توکن بعدی (Next-token prediction): برای آموزش توالیهای گسسته مانند متون و فرامین نمادین به کار میرود.
- تطبیق جریان (Flow matching): مسئول آموزش تولید پیوسته برای تصاویر، ویدیوها و مسیرهای حرکتی ربات است.
یک ستون فقرات مشترک باعث میشود سیگنالهای یادگیری چندین تسک مختلف، نمایشهای درونی یکدیگر را ارتقا دهند. ادعای کلیدی پژوهشگران Reka این است که بهبود مهارتهای استدلال، خلق محتوای ویدیویی و کنترل فیزیکی میتوانند یکدیگر را تقویت کنند؛ هرچند نسخه پیشنمایش فعلی فاقد چکپوینتهای عمومی یا آزمایشهای حذفی (Ablation Studies) کافی برای سنجش مستقل این ادعاست.
چالش واگرایی و خطای تفکیک؛ سقف تواناییهای فعلی مدل
تیم توسعه Reka به چندین محدودیت کلیدی اشاره کرده که مانع از کاربرد عملی و تجاری این مدل در مقیاس صنعتی میشود:
- واگرایی در گذر زمان (Long-horizon drift): در یک ویدیوی استریم ۳۰ ثانیهای، مدل بافتها و جزئیات ریز را حفظ میکند اما ساختار هندسی اتاق بهمرور تغییر کرده و شکل نامتعادلی به خود میگیرد.
- لنگرگاه زمانی و ردیابی (Temporal grounding): کادرهای محدودکننده روی تصاویر ثابت عملکرد خوبی دارند، اما در امتداد ویدیو نمیتوانند اشیا را با اتکای بالا دنبال کنند.
- پایداری ویرایش (Editing stability): ویرایشهای هدفمند در برخی پرامپتهای منتخب عالی عمل میکنند، ولی در ورودیهای متنوعتر شکننده هستند.
- کیفیت و وضوح (Resolution): خروجی ویدیویی نیتیو مدل فعلاً به رزولوشن ۶۷۲ در ۳۸۴ پیکسل محدود شده است.
اگرچه دموهای منتشرشده قدرت ادامهدهی بصری تعاملی را به رخ میکشند، اما هنوز شبیهسازی دقیق و کالیبرهشده فیزیکی، برنامهریزی بلندمدت مطمئن یا کنترل حلقه بسته ایمن برای رباتها را تضمین نمیکنند. علاوه بر این، تجمیع همهچیز در یک مدل ریسک خطا را متمرکز میکند؛ هر لغزش در وضعیت اشتراکی میتواند استدلال، ساخت ویدیو و خروجی حرکتی را بهطور همزمان مختل سازد.
حذف واسطهها در عین دسترسی محدود و کنترلشده
برای توسعهدهندگان نرمافزار، این معماری میتواند مدیریت وضعیت را در حوزههای ادیت، تحلیل داده، شبیهسازی و کنترل رباتیک بسیار آسانتر کند. وقتی هر عملیات به یک کانتکست یکتا رجوع کند، لایههای تبدیل فرمت و فراخوانیهای متعدد شبکه میان مدلهای گوناگون حذف میشوند. با این وجود، استقرار عملیاتی یک مدل ۱۹ میلیارد پارامتری که ویدیو نیز تولید میکند، نیازمند حافظه پردازشی فوقالعاده و زیرساخت بسیار قدرتمندی خواهد بود.
کاربردهای بالقوه چنین فناوری جذابی شامل شبیهسازیهای شاخهدار رباتیک، ابزارهای تعاملی تدوین ویدیو، و مدلهای خطمشی است که قبل از هرگونه حرکت فیزیکی، نتایج بصری آن را پیشبینی میکنند. البته موفقیت تجاری واقعی آنها در گرو تولید ویدیوهای طولانیتر، ردیابی زمانی دقیقتر، رزولوشنهای بالاتر و اثبات انطباق با قوانین پویای فیزیک در دنیای واقعی است.
در حال حاضر مدل Rho-1 همچنان در فاز پیشنمایش تحقیقاتی قرار دارد و دسترسی به آن صرفاً از طریق همکاریهای ویژه در بستر سرویس ابری Reka Cloud امکانپذیر است. شرکت Reka هنوز وزنهای عمومی مدل یا API همگانی آن را منتشر نکرده است؛ بنابراین توسعهدهندگان فعلاً نمیتوانند آن را مستقیماً در پروژههای خود ادغام کرده یا ادعاهای عملکردی آن را بهصورت مستقل ارزیابی کنند.
مطالب مرتبط و پیشنهادی

هوش مصنوعی در نقش خواهر بزرگتر؛ راهاندازی استارتاپ Hot Girl Hotline برای مشاوره روابط عاطفی
دو خواهر کارآفرین استارتاپی به نام Hot Girl Hotline راهاندازی کردهاند که با استفاده از مدلهای هوش مصنوعی، نقش یک خواهر بزرگتر امین را برای دختران جوان بازی میکند و به آنها در روابط عاطفی مشاوره میدهد. این پلتفرم برخلاف چتباتهای عمومی، روی پیشگیری از وابستگی روحی و بازگرداندن فرد به زندگی واقعی تمرکز دارد و دادههای کاربران را هم کاملاً محرمانه نگه میدارد.

شاید همکار بغلدستیتان خورهی مخفی هوش مصنوعی باشد؛ چرا کارمندان پرامپتهای خود را لو نمیدهند؟
شاید همکار بغلدستی شما بدون اینکه رو کند، یک نابغه تمامعیار در کار با ابزارهای هوش مصنوعی باشد! گزارشهای تازه نشان میدهد بخش بزرگی از کارمندان، پرامپتهای جادویی و روشهای کار با AI را مثل یک راز بزرگ پیش خودشان نگه میدارند تا دست بالا را در شرکت داشته باشند. این پنهانکاری جالب نه از سر بدجنسی، بلکه ناشی از ترس عمیق کارکنان از بالا رفتن بیرویه انتظارات مدیران و رقابت شغلی است.

انقلاب ایجنتهای خوداصلاحگر؛ وقتی هوش مصنوعی کدهای خودش را از نو بازنویسی میکند!
تا پیش از این، برنامهنویسها ساعتها وقت صرف تنظیم دستی پرامپتها و ابزارها میکردند تا ایجنتهای هوش مصنوعی اندکی بهتر عمل کنند؛ اما حالا ورق برگشته است. پژوهشگران چارچوبهایی ابداع کردهاند که به ایجنتها امکان میدهد با تحلیل خطاهای گذشته، دستورالعملها و کدهای خود را بازنویسی و ارتقا دهند. این دستاورد مسیر را برای ساخت سیستمهای خوداصلاحگری هموار میکند که بدون نیاز به دخالت انسان روزبهروز باهوشتر میشوند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.