Прорыв в робототехнике: FLUX 3 Action лидирует в RoboLab-120
Лаборатория Black Forest Labs (BFL), известная своими генеративными моделями FLUX, выпустила FLUX 3 Action — модель класса World Action Model (WAM) с 7 миллиардами параметров. Эта архитектура предназначена для управления роботами: она анализирует кадры с камер, состояние робота и текстовые инструкции, чтобы одновременно предсказывать будущие видеокадры и следующий чанк действий.
Ключевое достижение модели — 42.92% успеха задач на бенчмарке RoboLab-120. Это позволяет ей занять первое место в рейтинге, опередив главного конкурента от NVIDIA — Cosmos 3 Nano (36.8%). При этом FLUX 3 Action использует на 56% меньше параметров, чем 16-миллиардная модель Cosmos.
Сравнение с конкурентами: точность против скорости
Рынок открытых политик для роботов традиционно требовал выбора между качеством (WAM) и скоростью (VLA). FLUX 3 Action стирает эту границу, используя дистилляцию и более легкий бэкбон. Ниже приведено сравнение результатов на RoboLab-120:
| Модель | Тип | Параметры | RoboLab-120 (Success Rate) |
|---|---|---|---|
| FLUX 3 Action | WAM | 7B | 42.92% |
| Cosmos 3 Nano | WAM | 16B | 36.8% |
| π0.5 | VLA | 3.3B | 28.0% |
| DreamZero | WAM | 14B | 25.7% |
| GR00T N1.6 | VLA | 3B | 7.2% |
Архитектура и обучение: важность препроцессинга
Модель базируется на мультимодальном бэкбоне FLUX 3. Обучение прошло два этапа:
- Pretraining: Использовались данные изображений, видео и аудио. Видео составляло более 95% токенов обучения. Без этого этапа обучение только на данных DROID давало успех менее 1%.
- Midtraining: Смесь препроцессинговых данных (36.95%) и видео, выровненных по действиям (63.05%). Данные охватывали 14 типов роботов, включая телеоперацию и запись игр, используя общее пространство действий EE50 (50 измерений).
Производительность и развертывание
FLUX 3 Action предлагает три варианта чекпоинтов, оптимизированных под разные задачи:
- Base: 4 шага сэмплирования. Базовая производительность.
- Guidance-distilled: В 1.8–2 раза быстрее, точность выше на 0.6–1.08 pp.
- Step-distilled: 1 шаг сэмплирования, в 3.15–4 раза быстрее, но с потерей точности на 3.5–4.3 pp.
Для работы политики DROID требуется около 32 ГБ памяти GPU (BF16) на H200, но модель помещается в 24 ГБ (FP8) при выгрузке текстового энкодера. На RTX 5090 шаг-дистиллированная версия работает медленнее π0.5, но на workstation и datacenter GPU она превосходит π0.5 по скорости обработки реального времени (1.34x–2.28x).
Гибридный контроль и интеграция
BFL также продемонстрировала эффективность гибридного подхода с использованием LLM GPT 6 Astra в качестве «разумного» слоя. При низких усилиях рассуждения гибридная система решает 90% эпизодов за $8.77 и 8 минут 8 секунд, тогда как чистый Astra (максимальные усилия) тратит $13.47 и 16 минут 23 секунды на 100% решение.
Модель интегрирована в Hugging Face LeRobot и поддерживает развертывание на NVIDIA Jetson. Лицензия FLUX Kommunity разрешает некоммерческое использование. Важно отметить: модель выдает целевые значения без встроенных ограничений скорости или силы, поэтому разработчик должен самостоятельно накладывать эти ограничения в приложении.
Бенчмарки
| Бенчмарк | FLUX 3 Action | Cosmos 3 Nano | DreamZero | π0.5 |
|---|---|---|---|---|
| RoboLab-120 | 42.92% | 36.8% | 25.7% | 28% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
