رونمایی از FLUX 3 Action؛ مدل رباتیک متنباز Black Forest Labs که با نصف اندازه رقبا در صدر بنچمارکها قرار گرفت
استارتاپ Black Forest Labs مدل رباتیک جدید خود با نام FLUX 3 Action را معرفی کرد. این مدل هفت میلیارد پارامتری که برای هدایت رباتها و پهپادها در دنیای واقعی توسعه یافته، توانست جایگاه نخست بنچمارکهای رباتیک را به خود اختصاص دهد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل متنباز FLUX 3 Action با ۷ میلیارد پارامتر، نرخ موفقیت ۴۲٫۹۲ درصدی را در بنچمارک RoboLab-120 ثبت کرد و از مدلهای سنگینتر پیشی گرفت.
- این سیستم علاوه بر کنترل رباتهای فیزیکی، قادر به هدایت پهپادها و حتی انجام موفق بازی ویدیویی Doom تنها با تکیه بر درک بصری است.
- با وجود اندازه کوچکتر نسبت به رقبا، مدل جدید این شرکت سرعت استنتاج بالاتر و تاخیر کمتری در تصمیمگیریهای رباتیک ارائه میدهد.
- قرار است وزنها، کدهای آموزشی و دستورالعملهای این مدل بهزودی برای استفاده گستردهتر توسعهدهندگان منتشر شود.
استارتاپ آلمانی Black Forest Labs (BFL) که بیشتر به خاطر مدلهای تولید تصویر و ویدیوی FLUX شناخته میشود، با معرفی FLUX 3 Action گام بلندی در حوزه رباتیک برداشته است. این «مدل اقدام جهانی» (World Action Model) با ۷ میلیارد پارامتر و وزنهای باز (open-weight)، برای دریافت مشاهدات دوربینی، وضعیت فعلی ربات و دستورات زبان طبیعی طراحی شده تا آنها را به اقدامات فیزیکی تبدیل کند.
به گفته این شرکت، FLUX 3 Action به نرخ موفقیت کلی ۴۲٫۹۲ درصد در بنچمارک RoboLab-120 شرکت NVIDIA دست یافته است؛ دستاوردی که این مدل را بالاتر از تمامی مدلهای موجود در جدول ردهبندی عمومی قرار میدهد.
موضوع مهمتر برای توسعهدهندگانی که به دنبال پیادهسازی عملی مدلهای رباتیک هستند، اندازه این سیستم است. بنا بر اعلام BFL، مدل FLUX 3 Action تنها ۷ میلیارد پارامتر دارد که در مقایسه با مدل ۱۶ میلیارد پارامتری Cosmos3-Nano-Policy از NVIDIA بسیار بهینهتر است. این مدل با استفاده از ۴۴ درصد پارامتر کمتر، ۱٫۴۳ برابر سریعتر اجرا میشود.
شرکت BFL همچنین در حال آزمایش همین معماری در خارج از حوزه رباتیک فیزیکی است. این رویکرد را میتوان به شبیهسازیها، بازیها و محیطهای نرمافزاری تعمیم داد؛ یعنی فضاهایی که مدل باید بهطور مشابه تغییرات بصری را تفسیر کرده و درباره اقدام بعدی خود تصمیمگیری کند.
بنا بر اعلام این استارتاپ، آنها سیاستهای مبتنی بر وظیفه خاصی را برای مدل FLUX 3 Action آموزش دادهاند که شامل هدایت پهپادها در دنیای واقعی و حتی انجام موفقیتآمیز بازی محبوب Doom بدون کشته شدن در محیط بازی میشود. در این بازی، مدل با استفاده از زاویه دید اولشخص و کنترل اسلحه شخصیت اصلی، محیط را هدایت کرده است.
البته این شرکت تأکید دارد که این نتایج، آزمایشهای اولیه محسوب میشوند و هنوز تا قابلیتهای آماده برای تولید نهایی فاصله دارند.
شرکت BFL اعلام کرد قصد دارد وزنها، کدها، دستورالعملهای تنظیم دقیق (Fine-tuning)، بنچمارکها و نمونههای قابل تکرار را در دسترس قرار دهد. این موارد شامل یک پیادهسازی با استفاده از ربات نسبتاً ارزانقیمت SO-101 و چارچوب LeRobot از Hugging Face خواهد بود. تیمهای توسعه نیز میتوانند این مدل را با استفاده از دادههای جمعآوریشده از رباتهای اختصاصی خود، تنظیم دقیق کنند.
پیشنمایش اولیه FLUX 3 Action تابستان امسال و همزمان با معرفی خانواده گستردهتر FLUX 3 ارائه شد. در آن زمان، این مدل تنها برای شرکای تجاری و تحقیقاتی منتخب در دسترس بود و وعده انتشار عمومی مدل متنباز FLUX 3 Dev به آینده موکول شد.
رکوردشکنی در بنچمارک RoboLab
بنچمارک RoboLab یک محیط شبیهسازی توسعهیافته توسط NVIDIA است که برای آزمایش سیاستهای رباتیک همهمنظوره در ۱۲۰ کارکرد مختلف طراحی شده است. این کارکردها درک بصری، استدلال رابطهای و مهارتهای رویهای را با سطوح دشواری متفاوت و متغیرهایی در نحوه توصیف وظایف پوشش میدهند. شرکت NVIDIA این بنچمارک را تا حدودی برای جلوگیری از اشباعشدگی طراحی کرد تا با پیشرفت مدلها، ابزارهای ارزیابی قدیمیتر کارایی خود را از دست ندهند.
طبق گفته BFL، امتیاز ۴۲٫۹۲ درصدی FLUX 3 Action به معنای برتری ۶٫۱ درصدی آن نسبت به مدل Cosmos 3 است که پیش از این بالاترین امتیاز مدلهای متنباز را در RoboLab در اختیار داشت. این در حالی است که Cosmos3-Nano-Policy دارای ۱۶ میلیارد پارامتر است، اما نماینده BFL تنها ۷ میلیارد پارامتر دارد.
البته تصویر رقابتی در این حوزه فراتر از رتبهبندی RoboLab است. درست پیش از انتشار مدل جدید BFL، مدل OASIS WAM با امتیاز ۳۹٫۰ درصد در صدر جدول کلی RoboLab-120 قرار داشت؛ اما در نهایت FLUX 3 Action گوی سبقت را ربود.

مقایسه اندازه در برابر Cosmos معنادار است، اگرچه FLUX 3 Action در کل بازار مدلهای رباتیک بهطور غیرعادی کوچک به حساب نمیآید.
بهعنوان مثال، مدل MolmoAct 2 از Ai2 تقریباً ۵ میلیارد پارامتر دارد و NVIDIA نیز یک نسخه ۳ میلیارد پارامتری از GR00T N1.7 را توزیع میکند. با این حال، دستاورد اصلی BFL این است که توانسته با پارامترهای بسیار کمتر نسبت به مدل متنباز پیشگام قبلی در بنچمارک RoboLab، به نرخ موفقیت بالاتری دست یابد.
باید توجه داشت که مدلهایی مانند MolmoAct 2 و نسخههای جدیدتر GR00T متعلق به NVIDIA بر اساس ترکیبی از وظایف رباتیک شبیهسازیشده و دنیای واقعی ارزیابی میشوند و به همین دلیل در حال حاضر در کنار FLUX 3 Action در بنچمارک RoboLab دیده نمیشوند.
این موضوع مقایسههای عددی مستقیم را دشوار میکند؛ چالشی همیشگی در دنیای رباتیک که در آن سختافزار، توزیع وظایف، نمایشها و محیطهای ارزیابی میتواند بین گروههای تحقیقاتی تفاوتهای چشمگیری داشته باشد.
با این وجود، استارتاپ BFL تأکید ویژهای بر سرعت استنتاج دارد. نتایج ارائهشده توسط این شرکت، مدلها را با استفاده از فاکتور زمان واقعی مقایسه میکند؛ یعنی نسبت تأخیر استنتاج به مدت زمان اقدام فیزیکی ربات. اعداد پایینتر نشاندهنده عملکرد بهتر هستند، زیرا به این معناست که مدل زمان کمتری را برای تصمیمگیری صرف میکند.
شرکت BFL میگوید نسخههای تقطیرشده (Distilled) از FLUX 3 Action یک مرز پارتو (Pareto frontier) جدید بین نرخ موفقیت RoboLab و سرعت استنتاج در پردازندههای گرافیکی دیتاسنترها ایجاد کردهاند و این مدل توانسته ضمن حفظ نرخ موفقیت بسیار بالاتر، از π0.5 در فاکتور زمان واقعی پیشی بگیرد.
این معیارها برای استقرار در دنیای واقعی حیاتی هستند؛ سیاستی که امتیاز خوبی میگیرد اما نمیتواند به سرعت اقدامات مستمر تولید کند، خطر توقف، لرزش یا واکنشهای تاخیری ربات را به همراه دارد. البته نتایج جدید FLUX پیش از انتشار رسمی توسط BFL ارائه شدهاند و جدول رتبهبندی عمومی NVIDIA هنوز با دادههای FLUX 3 Action بهروزرسانی نشده بود.
همچنین تفکیک دستهبندیهای مختلف مدلها اهمیت دارد. شرکتهای BFL و NVIDIA مدلهای FLUX 3 Action و Cosmos 3 را بهعنوان «مدلهای اقدام جهانی» (World Action Models) طبقهبندی میکنند که پیشبینیها درباره نحوه تغییر جهان را با تولید اقدام پیوند میدهند.
در مقابل، مدل π0.5 از Physical Intelligence و خانواده GR00T از NVIDIA مدلهای بینایی-زبان-اقدام (VLA) محسوب میشوند، در حالی که Ai2 مدل MolmoAct 2 را یک «مدل استدلال اقدام» (Action Reasoning Model) مینامد. همه این سیستمها میتوانند در پردازشهای مربوط به دستکاری رباتیک با هم رقابت کنند، اما لزوماً اقدامات را به یک شکل یاد نمیگیرند یا تولید نمیکنند.
پیشبینی رویدادهای آینده و اقدامات بعدی ربات
معماری این سیستم بر پایه نظریهای استوار است که BFL بخش زیادی از سال جاری را صرف توسعه آن کرده است: مدلی که بهطور عمیق با ویدیوها آموزش دیده باشد، باید بازنماییهای مفیدی از حرکت، تماس، رفتار اشیا و روابط علتومعلولی را یاد بگیرد و سپس این درک را برای کنترل رباتیک به کار ببندد.
مدل FLUX 3 Action بر اساس پیشآموزشهای تصویر، ویدیو و صوتی مدل FLUX 3 ساخته شده است، اما BFL میگوید از معماری کوچکتر و بهینهشدهای برای استقرار عملی بهره میبرد. در طول آموزشهای تکمیلی، این سیستم یاد میگیرد که فریمهای ویدیویی و اقدامات آینده را بهصورت همزمان پیشبینی کند.
در زمان استنتاج، مدل فریمهای اخیر دوربین، وضعیت سیستم و توصیف وظیفه را دریافت میکند و ۳۲ اقدام بعدی را همراه با پیشبینی از نحوه تغییر صحنه بصری بازمیگرداند. سپس ربات محیط بهروزشده را مشاهده کرده و این روند را تکرار میکند.
این رویکرد ریشه در تحقیقات Self-Flow متعلق به BFL دارد که تلاش میکند یک مدل مولد، بازنماییهای مفیدی از ورودیهای خود را همزمان با یادگیری تولید آنها، فرا بگیرد. این استراتژی در واقع تلاشی برای حذف وابستگی به مدلهای بازنمایی مجزا مانند CLIP یا DINO است که بعداً به توسعه FLUX 3 منجر شد.
استارتاپ BFL کد استنتاج Self-Flow و یک چکپوینت ImageNet را منتشر کرده است، هرچند کدهای آموزش کامل و چکپوینت مدل ویدیویی هنوز عمومی نشدهاند.
این ارتباط بین تولید هوش مصنوعی و رباتیک پیش از این نیز در سیستم FLUX-mimic که با همکاری استارتاپ سوئیسی mimic robotics ساخته شد، قابل مشاهده بود. این سیستم از زیرساخت ویدیویی FLUX 3 برای کنترل رباتها در محیطهای صنعتی استفاده میکرد و در خطوط تولید شرکت آئودی مورد آزمایش قرار گرفت.
بنا بر اعلام BFL، سیاستی که در دموهای جدید نشان داده شده است، با استفاده از حدود ۲۰۰ اپیزود هدایت از راه دور شامل چند کارکرد برداشتن و گذاشتن اشیا تنظیم دقیق شده است. همچنین اشیای نمایشدادهشده در ویدیوهای آزمایشی، در مجموعه دادههای آموزشی حضور نداشتهاند.
در یکی از دموها، ربات در ابتدا اشتباه میکند و سپس دوباره برای انجام وظیفه تلاش میکند. محققان این رفتار را اینگونه توصیف میکنند: «مدل ابتدا شکست خورد و سپس دوباره و بهتر تلاش کرد.»
این مسئله نشان میدهد که BFL امیدوار است یک مدل جهانی پیشآموزشدیده، بتواند بدون نیاز به نمایش تکتک خطاهای ممکن در فرآیند آموزش، مسیر بازیابی خودکار را طی کند.
استارتاپ BFL تنها شرکتی نیست که معتقد است یک مدل پیشآموزشدیده وسیع میتواند نیاز به دادههای خاص هر ربات را کاهش دهد. شرکت Google DeepMind نیز اعلام کرده که مدل اختصاصی Gemini Robotics On-Device 2 VLA میتواند با کمتر از ۲۰۰ نمونه، خود را با کالبدهای جدید رباتیک تطبیق دهد.
در سمت مدلهای متنباز، MolmoAct 2 از Ai2 ممکن است مستقیمترین نقطه مقابل استراتژی انتشار BFL باشد. تیم Ai2 نهتنها وزنهای MolmoAct 2، بلکه کدهای آموزشی، اسکریپتهای تنظیم دقیق، مجموعه دادهها و یکپارچگی با LeRobot را نیز منتشر کرده است. با این حال، هنوز یک بنچمارک واحد برای ارزیابی جامع بین شبیهسازی، سختافزار واقعی و کالبدهای مختلف رباتیک در این صنعت وجود ندارد.
حرکت BFL از تولید تصویر به سمت هوش مصنوعی فیزیکی
معرفی FLUX 3 Action نشان میدهد که دامنه فعالیتهای BFL از زمان تاسیس در سال ۲۰۲۴ با چه سرعتی در حال گسترش است.
این استارتاپ توسط محققانی تاسیس شد که در پس فناوریهایی مانند Stable Diffusion قرار داشتند و در ابتدا با مدلهای تولید تصویر خانواده FLUX.1 شهرت یافتند. این شرکت سپس با FLUX1.1 Pro یک API تجاری ارائه کرد و دامنه مدلهای خود را با خانواده FLUX.2 و مدلهای بهینهسازیشده برای سرعت بالا توسعه داد.
شرکت BFL اخیراً یک جذب سرمایه ۳۰۰ میلیون دلاری سری B را با ارزشگذاری ۳٫۲۵ میلیارد دلاری پشت سر گذاشته و مجموع سرمایه جذبشده خود را به بیش از ۴۵۰ میلیون دلار رسانده است. این شرکت اکنون در فرایبورگ آلمان و سانفرانسیسکو فعالیت میکند.
اگرچه دسترسی به خدمات تولید ویدیوی BFL از طریق API و با قیمتگذاری مشخص در دسترس قرار دارد، اما هنوز خبری از اعلام قیمتها یا مجوزهای تجاری خاص برای API مدل جدید FLUX 3 Action نیست.
این رویکرد، مدل FLUX 3 Action را در اکوسیستمی شلوغ از مدلهای رباتیک متکی بر کدهای متنباز قرار میدهد:
مدل GR00T N1.7 شرکت NVIDIA که بهار امسال منتشر شد، یک VLA سهمیلیارد پارامتری و متنباز است که بر روی دستکاری کالبدهای رباتیک متمرکز است.
مدل MolmoAct 2 که اوایل امسال منتشر شد، بهطور مشابه بر سازگاری محلی متمرکز است و مستقیماً با LeRobot ادغام میشود.
در مقابل، مدل Gemini Robotics On-Device 2 از گوگل نشاندهنده بخش اختصاصی این طیف است؛ این مدل برای اجرای محلی روی سختافزار ربات طراحی شده، اما گوگل فعلا دسترسی به آن را محدود نگه داشته است.
بنابراین، انتشار وزنهای باز FLUX 3 Action میتواند پیامدهای مهمی داشته باشد. شرکت BFL به جای اینکه از تیمها بخواهد خودشان یک مدل پایه رباتیک بزرگ را آموزش دهند، شرط میبندد که توسعهدهندگان میتوانند با یک مدل نسبتاً فشرده با درک بصری و فیزیکی گسترده شروع کنند، نمونههایی را روی سختافزار خود جمعآوری کرده و مدل را برای وظایف مختلف سازگار کنند.
انتشار وزنهای باز همچنین به تیمها گزینه استقرار متفاوتی نسبت به سرویسهای ابری رباتیک میدهد: آنها میتوانند مدل را بررسی و اصلاح کنند، استنتاج را در زیرساخت خودشان انجام دهند و دادههای عملیاتی رباتیک خود را مخفی نگه دارند. البته میزان انعطافپذیری تجاری این رویکرد، در نهایت به شرایط لایسنس BFL بستگی دارد.
اعداد ثبتشده در بنچمارکها نشان میدهند که این رویکرد در محیطهای شبیهسازیشده رقابتی است. اکنون مسئله کلیدی این نیست که آیا FLUX 3 Action میتواند یک مدل خاص را در یک جدول ردهبندی شکست دهد یا خیر؛ بلکه پرسش اصلی این است که آیا ترکیب پیشآموزشهای یک مدل جهانی با معماری ۷ میلیارد پارامتری، متنباز بودن و قابلیت تنظیم دقیق، میتواند در میان تنوع گسترده رباتهای واقعی در دنیای تولید و صنعت کارآمد باشد یا خیر.
آزمایش بعدی این خواهد بود که آیا تیمهای خارج از این استارتاپ میتوانند این دستاوردها را روی رباتهای خود تکرار کنند و آیا این حجم کاهشیافته و دسترسی باز به کدهای FLUX 3 Action، استفاده از آن را برای محیطهای تولیدی به اندازه کافی کاربردی و بهصرفه میکند یا خیر.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.