Релиз модели26 июля 2026 г., 22:17 МСК🤖 Auto

Black Forest Labs выпустила FLUX 3: мультимодальная модель с видео, аудио и управлением роботами

Black Forest Labs представила FLUX 3 — первую модель семейства FLUX, объединяющую генерацию изображений, видео с нативным звуком и предсказание действий роботов в единой архитектуре на базе метода Self-Flow.

Баннер новости 4434

Единая архитектура для всех модальностей

Black Forest Labs (BFL) выпустила FLUX 3, фундаментальную модель, обученную на изображениях, видео и аудио одновременно. В отличие от предыдущих версий, FLUX 3 использует один набор весов для генерации видео, аудио и предсказания действий (action prediction). Исследователи утверждают, что каждая модальность является «потерянной проекцией» одной реальности: звук должен соответствовать удару, а движение — подчиняться массе. Совместное обучение позволяет модальностям контролировать друг друга, повышая физическую достоверность результатов.

Возможности FLUX 3 Video

Модель генерирует видеоклипы длительностью до 20 секунд в одном проходе с нативным аудио. Поддерживаются режимы text-to-video, image-to-video, video-to-video, keyframe-to-video и генеративное продолжение видео-аудио. Особый акцент сделан на точности человеческих мимик и синхронизации звуков с физическими событиями. Также заявлена поддержка многоязычного диалога и агентного связывания клипов в многосерийные последовательности.

Результаты сравнительного тестирования

BFL опубликовала предварительные результаты человеческого предпочтения (human preference) для 10-секундных клипов в 720p с аудио. FLUX 3 демонстрирует лидерство в большинстве сравнений, хотя и уступает в некоторых нишевых кейсах.

Соперник Доля предпочтений FLUX 3 Примечание
Luma Ray 3.2 93% Резкое превосходство
Runway Gen-4.5 77% Сильное преимущество
Grok Imagine Video 69% Уверенная победа
Kling v3 Pro 60% Умеренное преимущество
Happy Horse v1 59% Преимущество
Happy Horse 1.1 57% Преимущество
Seedance 2.0 / Gemini Omni Flash 52% Близко к случайному выбору

Техническая основа: Self-Flow

FLUX 3 построена на методе Self-Flow, который сочетает objective flow matching с самонадзором для реконструкции признаков. Архитектура использует SiT-XL/2 с по-токеновым таймстеп-условием. Обучение проходит с маской 25% на токен и самодистилляцией от учителя (EMA) на 20-м слое к студенту на 8-м. Важно отметить, что видео-генерация потребляет более 95% вычислительных ресурсов при обучении, тогда как на аудио приходится менее 0.5% токенов.

Робототехника и доступ

Одной из ключевых особенностей является способность модели предсказывать действия роботов. На базе FLUX 3 создана модель FLUX-mimic, работающая в реальном времени (менее 80 мс) на одной видеокарте RTX 5090. Доступ к видео- и action-модулям находится в стадии раннего доступа (Early Access), генерация изображений будет доступна позже, а открытые веса (open weights) появятся в последнюю очередь. Цены на коммерческое использование пока не опубликованы.

Источник: MarkTechPost ↗