پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی از FLUX 3 Action؛ مدل رباتیک متن‌باز Black Forest Labs که با نصف اندازه رقبا در صدر بنچمارک‌ها قرار گرفت

انتشار:۱ مهر ۱۴۰۵(۵ روز پیش)
۱۰ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Black Forest Labs مدل رباتیک جدید خود با نام FLUX 3 Action را معرفی کرد. این مدل هفت میلیارد پارامتری که برای هدایت ربات‌ها و پهپادها در دنیای واقعی توسعه یافته، توانست جایگاه نخست بنچمارک‌های رباتیک را به خود اختصاص دهد.

رونمایی از FLUX 3 Action؛ مدل رباتیک متن‌باز Black Forest Labs که با نصف اندازه رقبا در صدر بنچمارک‌ها قرار گرفت

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل متن‌باز FLUX 3 Action با ۷ میلیارد پارامتر، نرخ موفقیت ۴۲٫۹۲ درصدی را در بنچمارک RoboLab-120 ثبت کرد و از مدل‌های سنگین‌تر پیشی گرفت.
  • این سیستم علاوه بر کنترل ربات‌های فیزیکی، قادر به هدایت پهپادها و حتی انجام موفق بازی ویدیویی Doom تنها با تکیه بر درک بصری است.
  • با وجود اندازه کوچکتر نسبت به رقبا، مدل جدید این شرکت سرعت استنتاج بالاتر و تاخیر کمتری در تصمیم‌گیری‌های رباتیک ارائه می‌دهد.
  • قرار است وزن‌ها، کدهای آموزشی و دستورالعمل‌های این مدل به‌زودی برای استفاده گسترده‌تر توسعه‌دهندگان منتشر شود.

استارتاپ آلمانی Black Forest Labs (BFL) که بیشتر به خاطر مدل‌های تولید تصویر و ویدیوی FLUX شناخته می‌شود، با معرفی FLUX 3 Action گام بلندی در حوزه رباتیک برداشته است. این «مدل اقدام جهانی» (World Action Model) با ۷ میلیارد پارامتر و وزن‌های باز (open-weight)، برای دریافت مشاهدات دوربینی، وضعیت فعلی ربات و دستورات زبان طبیعی طراحی شده تا آن‌ها را به اقدامات فیزیکی تبدیل کند.

به گفته این شرکت، FLUX 3 Action به نرخ موفقیت کلی ۴۲٫۹۲ درصد در بنچمارک RoboLab-120 شرکت NVIDIA دست یافته است؛ دستاوردی که این مدل را بالاتر از تمامی مدل‌های موجود در جدول رده‌بندی عمومی قرار می‌دهد.

موضوع مهم‌تر برای توسعه‌دهندگانی که به دنبال پیاده‌سازی عملی مدل‌های رباتیک هستند، اندازه این سیستم است. بنا بر اعلام BFL، مدل FLUX 3 Action تنها ۷ میلیارد پارامتر دارد که در مقایسه با مدل ۱۶ میلیارد پارامتری Cosmos3-Nano-Policy از NVIDIA بسیار بهینه‌تر است. این مدل با استفاده از ۴۴ درصد پارامتر کمتر، ۱٫۴۳ برابر سریع‌تر اجرا می‌شود.

شرکت BFL همچنین در حال آزمایش همین معماری در خارج از حوزه رباتیک فیزیکی است. این رویکرد را می‌توان به شبیه‌سازی‌ها، بازی‌ها و محیط‌های نرم‌افزاری تعمیم داد؛ یعنی فضاهایی که مدل باید به‌طور مشابه تغییرات بصری را تفسیر کرده و درباره اقدام بعدی خود تصمیم‌گیری کند.

بنا بر اعلام این استارتاپ، آن‌ها سیاست‌های مبتنی بر وظیفه خاصی را برای مدل FLUX 3 Action آموزش داده‌اند که شامل هدایت پهپادها در دنیای واقعی و حتی انجام موفقیت‌آمیز بازی محبوب Doom بدون کشته شدن در محیط بازی می‌شود. در این بازی، مدل با استفاده از زاویه دید اول‌شخص و کنترل اسلحه شخصیت اصلی، محیط را هدایت کرده است.

البته این شرکت تأکید دارد که این نتایج، آزمایش‌های اولیه محسوب می‌شوند و هنوز تا قابلیت‌های آماده برای تولید نهایی فاصله دارند.

شرکت BFL اعلام کرد قصد دارد وزن‌ها، کدها، دستورالعمل‌های تنظیم دقیق (Fine-tuning)، بنچمارک‌ها و نمونه‌های قابل تکرار را در دسترس قرار دهد. این موارد شامل یک پیاده‌سازی با استفاده از ربات نسبتاً ارزان‌قیمت SO-101 و چارچوب LeRobot از Hugging Face خواهد بود. تیم‌های توسعه نیز می‌توانند این مدل را با استفاده از داده‌های جمع‌آوری‌شده از ربات‌های اختصاصی خود، تنظیم دقیق کنند.

پیش‌نمایش اولیه FLUX 3 Action تابستان امسال و همزمان با معرفی خانواده گسترده‌تر FLUX 3 ارائه شد. در آن زمان، این مدل تنها برای شرکای تجاری و تحقیقاتی منتخب در دسترس بود و وعده انتشار عمومی مدل متن‌باز FLUX 3 Dev به آینده موکول شد.

رکوردشکنی در بنچمارک RoboLab

بنچمارک RoboLab یک محیط شبیه‌سازی توسعه‌یافته توسط NVIDIA است که برای آزمایش سیاست‌های رباتیک همه‌منظوره در ۱۲۰ کارکرد مختلف طراحی شده است. این کارکردها درک بصری، استدلال رابطه‌ای و مهارت‌های رویه‌ای را با سطوح دشواری متفاوت و متغیرهایی در نحوه توصیف وظایف پوشش می‌دهند. شرکت NVIDIA این بنچمارک را تا حدودی برای جلوگیری از اشباع‌شدگی طراحی کرد تا با پیشرفت مدل‌ها، ابزارهای ارزیابی قدیمی‌تر کارایی خود را از دست ندهند.

طبق گفته BFL، امتیاز ۴۲٫۹۲ درصدی FLUX 3 Action به معنای برتری ۶٫۱ درصدی آن نسبت به مدل Cosmos 3 است که پیش از این بالاترین امتیاز مدل‌های متن‌باز را در RoboLab در اختیار داشت. این در حالی است که Cosmos3-Nano-Policy دارای ۱۶ میلیارد پارامتر است، اما نماینده BFL تنها ۷ میلیارد پارامتر دارد.

البته تصویر رقابتی در این حوزه فراتر از رتبه‌بندی RoboLab است. درست پیش از انتشار مدل جدید BFL، مدل OASIS WAM با امتیاز ۳۹٫۰ درصد در صدر جدول کلی RoboLab-120 قرار داشت؛ اما در نهایت FLUX 3 Action گوی سبقت را ربود.

امتیازات مدل FLUX 3 Action در بنچمارک RoboLab-120 متعلق به Nvidia
امتیازات مدل FLUX 3 Action در بنچمارک RoboLab-120 متعلق به Nvidia.

مقایسه اندازه در برابر Cosmos معنادار است، اگرچه FLUX 3 Action در کل بازار مدل‌های رباتیک به‌طور غیرعادی کوچک به حساب نمی‌آید.

به‌عنوان مثال، مدل MolmoAct 2 از Ai2 تقریباً ۵ میلیارد پارامتر دارد و NVIDIA نیز یک نسخه ۳ میلیارد پارامتری از GR00T N1.7 را توزیع می‌کند. با این حال، دستاورد اصلی BFL این است که توانسته با پارامترهای بسیار کمتر نسبت به مدل متن‌باز پیشگام قبلی در بنچمارک RoboLab، به نرخ موفقیت بالاتری دست یابد.

باید توجه داشت که مدل‌هایی مانند MolmoAct 2 و نسخه‌های جدیدتر GR00T متعلق به NVIDIA بر اساس ترکیبی از وظایف رباتیک شبیه‌سازی‌شده و دنیای واقعی ارزیابی می‌شوند و به همین دلیل در حال حاضر در کنار FLUX 3 Action در بنچمارک RoboLab دیده نمی‌شوند.

این موضوع مقایسه‌های عددی مستقیم را دشوار می‌کند؛ چالشی همیشگی در دنیای رباتیک که در آن سخت‌افزار، توزیع وظایف، نمایش‌ها و محیط‌های ارزیابی می‌تواند بین گروه‌های تحقیقاتی تفاوت‌های چشمگیری داشته باشد.

با این وجود، استارتاپ BFL تأکید ویژه‌ای بر سرعت استنتاج دارد. نتایج ارائه‌شده توسط این شرکت، مدل‌ها را با استفاده از فاکتور زمان واقعی مقایسه می‌کند؛ یعنی نسبت تأخیر استنتاج به مدت زمان اقدام فیزیکی ربات. اعداد پایین‌تر نشان‌دهنده عملکرد بهتر هستند، زیرا به این معناست که مدل زمان کمتری را برای تصمیم‌گیری صرف می‌کند.

شرکت BFL می‌گوید نسخه‌های تقطیرشده (Distilled) از FLUX 3 Action یک مرز پارتو (Pareto frontier) جدید بین نرخ موفقیت RoboLab و سرعت استنتاج در پردازنده‌های گرافیکی دیتاسنترها ایجاد کرده‌اند و این مدل توانسته ضمن حفظ نرخ موفقیت بسیار بالاتر، از π0.5 در فاکتور زمان واقعی پیشی بگیرد.

این معیارها برای استقرار در دنیای واقعی حیاتی هستند؛ سیاستی که امتیاز خوبی می‌گیرد اما نمی‌تواند به سرعت اقدامات مستمر تولید کند، خطر توقف، لرزش یا واکنش‌های تاخیری ربات را به همراه دارد. البته نتایج جدید FLUX پیش از انتشار رسمی توسط BFL ارائه شده‌اند و جدول رتبه‌بندی عمومی NVIDIA هنوز با داده‌های FLUX 3 Action به‌روزرسانی نشده بود.

همچنین تفکیک دسته‌بندی‌های مختلف مدل‌ها اهمیت دارد. شرکت‌های BFL و NVIDIA مدل‌های FLUX 3 Action و Cosmos 3 را به‌عنوان «مدل‌های اقدام جهانی» (World Action Models) طبقه‌بندی می‌کنند که پیش‌بینی‌ها درباره نحوه تغییر جهان را با تولید اقدام پیوند می‌دهند.

در مقابل، مدل π0.5 از Physical Intelligence و خانواده GR00T از NVIDIA مدل‌های بینایی-زبان-اقدام (VLA) محسوب می‌شوند، در حالی که Ai2 مدل MolmoAct 2 را یک «مدل استدلال اقدام» (Action Reasoning Model) می‌نامد. همه این سیستم‌ها می‌توانند در پردازش‌های مربوط به دستکاری رباتیک با هم رقابت کنند، اما لزوماً اقدامات را به یک شکل یاد نمی‌گیرند یا تولید نمی‌کنند.

پیش‌بینی رویدادهای آینده و اقدامات بعدی ربات

معماری این سیستم بر پایه نظریه‌ای استوار است که BFL بخش زیادی از سال جاری را صرف توسعه آن کرده است: مدلی که به‌طور عمیق با ویدیوها آموزش دیده باشد، باید بازنمایی‌های مفیدی از حرکت، تماس، رفتار اشیا و روابط علت‌ومعلولی را یاد بگیرد و سپس این درک را برای کنترل رباتیک به کار ببندد.

مدل FLUX 3 Action بر اساس پیش‌آموزش‌های تصویر، ویدیو و صوتی مدل FLUX 3 ساخته شده است، اما BFL می‌گوید از معماری کوچک‌تر و بهینه‌شده‌ای برای استقرار عملی بهره می‌برد. در طول آموزش‌های تکمیلی، این سیستم یاد می‌گیرد که فریم‌های ویدیویی و اقدامات آینده را به‌صورت همزمان پیش‌بینی کند.

در زمان استنتاج، مدل فریم‌های اخیر دوربین، وضعیت سیستم و توصیف وظیفه را دریافت می‌کند و ۳۲ اقدام بعدی را همراه با پیش‌بینی از نحوه تغییر صحنه بصری بازمی‌گرداند. سپس ربات محیط به‌روزشده را مشاهده کرده و این روند را تکرار می‌کند.

این رویکرد ریشه در تحقیقات Self-Flow متعلق به BFL دارد که تلاش می‌کند یک مدل مولد، بازنمایی‌های مفیدی از ورودی‌های خود را همزمان با یادگیری تولید آن‌ها، فرا بگیرد. این استراتژی در واقع تلاشی برای حذف وابستگی به مدل‌های بازنمایی مجزا مانند CLIP یا DINO است که بعداً به توسعه FLUX 3 منجر شد.

استارتاپ BFL کد استنتاج Self-Flow و یک چک‌پوینت ImageNet را منتشر کرده است، هرچند کدهای آموزش کامل و چک‌پوینت مدل ویدیویی هنوز عمومی نشده‌اند.

این ارتباط بین تولید هوش مصنوعی و رباتیک پیش از این نیز در سیستم FLUX-mimic که با همکاری استارتاپ سوئیسی mimic robotics ساخته شد، قابل مشاهده بود. این سیستم از زیرساخت ویدیویی FLUX 3 برای کنترل ربات‌ها در محیط‌های صنعتی استفاده می‌کرد و در خطوط تولید شرکت آئودی مورد آزمایش قرار گرفت.

بنا بر اعلام BFL، سیاستی که در دموهای جدید نشان داده شده است، با استفاده از حدود ۲۰۰ اپیزود هدایت از راه دور شامل چند کارکرد برداشتن و گذاشتن اشیا تنظیم دقیق شده است. همچنین اشیای نمایش‌داده‌شده در ویدیوهای آزمایشی، در مجموعه داده‌های آموزشی حضور نداشته‌اند.

در یکی از دموها، ربات در ابتدا اشتباه می‌کند و سپس دوباره برای انجام وظیفه تلاش می‌کند. محققان این رفتار را این‌گونه توصیف می‌کنند: «مدل ابتدا شکست خورد و سپس دوباره و بهتر تلاش کرد.»

این مسئله نشان می‌دهد که BFL امیدوار است یک مدل جهانی پیش‌آموزش‌دیده، بتواند بدون نیاز به نمایش تک‌تک خطاهای ممکن در فرآیند آموزش، مسیر بازیابی خودکار را طی کند.

استارتاپ BFL تنها شرکتی نیست که معتقد است یک مدل پیش‌آموزش‌دیده وسیع می‌تواند نیاز به داده‌های خاص هر ربات را کاهش دهد. شرکت Google DeepMind نیز اعلام کرده که مدل اختصاصی Gemini Robotics On-Device 2 VLA می‌تواند با کمتر از ۲۰۰ نمونه، خود را با کالبدهای جدید رباتیک تطبیق دهد.

در سمت مدل‌های متن‌باز، MolmoAct 2 از Ai2 ممکن است مستقیم‌ترین نقطه مقابل استراتژی انتشار BFL باشد. تیم Ai2 نه‌تنها وزن‌های MolmoAct 2، بلکه کدهای آموزشی، اسکریپت‌های تنظیم دقیق، مجموعه داده‌ها و یکپارچگی با LeRobot را نیز منتشر کرده است. با این حال، هنوز یک بنچمارک واحد برای ارزیابی جامع بین شبیه‌سازی، سخت‌افزار واقعی و کالبدهای مختلف رباتیک در این صنعت وجود ندارد.

حرکت BFL از تولید تصویر به سمت هوش مصنوعی فیزیکی

معرفی FLUX 3 Action نشان می‌دهد که دامنه فعالیت‌های BFL از زمان تاسیس در سال ۲۰۲۴ با چه سرعتی در حال گسترش است.

این استارتاپ توسط محققانی تاسیس شد که در پس فناوری‌هایی مانند Stable Diffusion قرار داشتند و در ابتدا با مدل‌های تولید تصویر خانواده FLUX.1 شهرت یافتند. این شرکت سپس با FLUX1.1 Pro یک API تجاری ارائه کرد و دامنه مدل‌های خود را با خانواده FLUX.2 و مدل‌های بهینه‌سازی‌شده برای سرعت بالا توسعه داد.

شرکت BFL اخیراً یک جذب سرمایه ۳۰۰ میلیون دلاری سری B را با ارزش‌گذاری ۳٫۲۵ میلیارد دلاری پشت سر گذاشته و مجموع سرمایه جذب‌شده خود را به بیش از ۴۵۰ میلیون دلار رسانده است. این شرکت اکنون در فرایبورگ آلمان و سان‌فرانسیسکو فعالیت می‌کند.

اگرچه دسترسی به خدمات تولید ویدیوی BFL از طریق API و با قیمت‌گذاری مشخص در دسترس قرار دارد، اما هنوز خبری از اعلام قیمت‌ها یا مجوزهای تجاری خاص برای API مدل جدید FLUX 3 Action نیست.

این رویکرد، مدل FLUX 3 Action را در اکوسیستمی شلوغ از مدل‌های رباتیک متکی بر کدهای متن‌باز قرار می‌دهد:

  • مدل GR00T N1.7 شرکت NVIDIA که بهار امسال منتشر شد، یک VLA سه‌میلیارد پارامتری و متن‌باز است که بر روی دستکاری کالبدهای رباتیک متمرکز است.

  • مدل MolmoAct 2 که اوایل امسال منتشر شد، به‌طور مشابه بر سازگاری محلی متمرکز است و مستقیماً با LeRobot ادغام می‌شود.

  • در مقابل، مدل Gemini Robotics On-Device 2 از گوگل نشان‌دهنده بخش اختصاصی این طیف است؛ این مدل برای اجرای محلی روی سخت‌افزار ربات طراحی شده، اما گوگل فعلا دسترسی به آن را محدود نگه داشته است.

بنابراین، انتشار وزن‌های باز FLUX 3 Action می‌تواند پیامدهای مهمی داشته باشد. شرکت BFL به جای اینکه از تیم‌ها بخواهد خودشان یک مدل پایه رباتیک بزرگ را آموزش دهند، شرط می‌بندد که توسعه‌دهندگان می‌توانند با یک مدل نسبتاً فشرده با درک بصری و فیزیکی گسترده شروع کنند، نمونه‌هایی را روی سخت‌افزار خود جمع‌آوری کرده و مدل را برای وظایف مختلف سازگار کنند.

انتشار وزن‌های باز همچنین به تیم‌ها گزینه استقرار متفاوتی نسبت به سرویس‌های ابری رباتیک می‌دهد: آن‌ها می‌توانند مدل را بررسی و اصلاح کنند، استنتاج را در زیرساخت خودشان انجام دهند و داده‌های عملیاتی رباتیک خود را مخفی نگه دارند. البته میزان انعطاف‌پذیری تجاری این رویکرد، در نهایت به شرایط لایسنس BFL بستگی دارد.

اعداد ثبت‌شده در بنچمارک‌ها نشان می‌دهند که این رویکرد در محیط‌های شبیه‌سازی‌شده رقابتی است. اکنون مسئله کلیدی این نیست که آیا FLUX 3 Action می‌تواند یک مدل خاص را در یک جدول رده‌بندی شکست دهد یا خیر؛ بلکه پرسش اصلی این است که آیا ترکیب پیش‌آموزش‌های یک مدل جهانی با معماری ۷ میلیارد پارامتری، متن‌باز بودن و قابلیت تنظیم دقیق، می‌تواند در میان تنوع گسترده ربات‌های واقعی در دنیای تولید و صنعت کارآمد باشد یا خیر.

آزمایش بعدی این خواهد بود که آیا تیم‌های خارج از این استارتاپ می‌توانند این دستاوردها را روی ربات‌های خود تکرار کنند و آیا این حجم کاهش‌یافته و دسترسی باز به کدهای FLUX 3 Action، استفاده از آن را برای محیط‌های تولیدی به اندازه کافی کاربردی و به‌صرفه می‌کند یا خیر.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر