Релиз модели25 сентября 2026 г., 10:17 МСК🤖 Auto

Black Forest Labs выпустила FLUX 3 Action: 7B-модель для роботов, побившая Cosmos 3 Nano

Black Forest Labs представила FLUX 3 Action — первую с открытым весом модель типа WAM (7B параметров), которая заняла 1-е место в рейтинге RoboLab-120, превзойдя NVIDIA Cosmos 3 Nano по точности и скорости.

Баннер новости 8246

Прорыв в робототехнике: FLUX 3 Action лидирует в RoboLab-120

Лаборатория Black Forest Labs (BFL), известная своими генеративными моделями FLUX, выпустила FLUX 3 Action — модель класса World Action Model (WAM) с 7 миллиардами параметров. Эта архитектура предназначена для управления роботами: она анализирует кадры с камер, состояние робота и текстовые инструкции, чтобы одновременно предсказывать будущие видеокадры и следующий чанк действий.

Ключевое достижение модели — 42.92% успеха задач на бенчмарке RoboLab-120. Это позволяет ей занять первое место в рейтинге, опередив главного конкурента от NVIDIA — Cosmos 3 Nano (36.8%). При этом FLUX 3 Action использует на 56% меньше параметров, чем 16-миллиардная модель Cosmos.

Сравнение с конкурентами: точность против скорости

Рынок открытых политик для роботов традиционно требовал выбора между качеством (WAM) и скоростью (VLA). FLUX 3 Action стирает эту границу, используя дистилляцию и более легкий бэкбон. Ниже приведено сравнение результатов на RoboLab-120:

Модель Тип Параметры RoboLab-120 (Success Rate)
FLUX 3 Action WAM 7B 42.92%
Cosmos 3 Nano WAM 16B 36.8%
π0.5 VLA 3.3B 28.0%
DreamZero WAM 14B 25.7%
GR00T N1.6 VLA 3B 7.2%

Архитектура и обучение: важность препроцессинга

Модель базируется на мультимодальном бэкбоне FLUX 3. Обучение прошло два этапа:

  • Pretraining: Использовались данные изображений, видео и аудио. Видео составляло более 95% токенов обучения. Без этого этапа обучение только на данных DROID давало успех менее 1%.
  • Midtraining: Смесь препроцессинговых данных (36.95%) и видео, выровненных по действиям (63.05%). Данные охватывали 14 типов роботов, включая телеоперацию и запись игр, используя общее пространство действий EE50 (50 измерений).

Производительность и развертывание

FLUX 3 Action предлагает три варианта чекпоинтов, оптимизированных под разные задачи:

  • Base: 4 шага сэмплирования. Базовая производительность.
  • Guidance-distilled: В 1.8–2 раза быстрее, точность выше на 0.6–1.08 pp.
  • Step-distilled: 1 шаг сэмплирования, в 3.15–4 раза быстрее, но с потерей точности на 3.5–4.3 pp.

Для работы политики DROID требуется около 32 ГБ памяти GPU (BF16) на H200, но модель помещается в 24 ГБ (FP8) при выгрузке текстового энкодера. На RTX 5090 шаг-дистиллированная версия работает медленнее π0.5, но на workstation и datacenter GPU она превосходит π0.5 по скорости обработки реального времени (1.34x–2.28x).

Гибридный контроль и интеграция

BFL также продемонстрировала эффективность гибридного подхода с использованием LLM GPT 6 Astra в качестве «разумного» слоя. При низких усилиях рассуждения гибридная система решает 90% эпизодов за $8.77 и 8 минут 8 секунд, тогда как чистый Astra (максимальные усилия) тратит $13.47 и 16 минут 23 секунды на 100% решение.

Модель интегрирована в Hugging Face LeRobot и поддерживает развертывание на NVIDIA Jetson. Лицензия FLUX Kommunity разрешает некоммерческое использование. Важно отметить: модель выдает целевые значения без встроенных ограничений скорости или силы, поэтому разработчик должен самостоятельно накладывать эти ограничения в приложении.

Бенчмарки

БенчмаркFLUX 3 ActionCosmos 3 NanoDreamZeroπ0.5
RoboLab-12042.92%36.8%25.7%28%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗