Единая архитектура для всех модальностей
Black Forest Labs (BFL) выпустила FLUX 3, фундаментальную модель, обученную на изображениях, видео и аудио одновременно. В отличие от предыдущих версий, FLUX 3 использует один набор весов для генерации видео, аудио и предсказания действий (action prediction). Исследователи утверждают, что каждая модальность является «потерянной проекцией» одной реальности: звук должен соответствовать удару, а движение — подчиняться массе. Совместное обучение позволяет модальностям контролировать друг друга, повышая физическую достоверность результатов.
Возможности FLUX 3 Video
Модель генерирует видеоклипы длительностью до 20 секунд в одном проходе с нативным аудио. Поддерживаются режимы text-to-video, image-to-video, video-to-video, keyframe-to-video и генеративное продолжение видео-аудио. Особый акцент сделан на точности человеческих мимик и синхронизации звуков с физическими событиями. Также заявлена поддержка многоязычного диалога и агентного связывания клипов в многосерийные последовательности.
Результаты сравнительного тестирования
BFL опубликовала предварительные результаты человеческого предпочтения (human preference) для 10-секундных клипов в 720p с аудио. FLUX 3 демонстрирует лидерство в большинстве сравнений, хотя и уступает в некоторых нишевых кейсах.
| Соперник | Доля предпочтений FLUX 3 | Примечание |
|---|---|---|
| Luma Ray 3.2 | 93% | Резкое превосходство |
| Runway Gen-4.5 | 77% | Сильное преимущество |
| Grok Imagine Video | 69% | Уверенная победа |
| Kling v3 Pro | 60% | Умеренное преимущество |
| Happy Horse v1 | 59% | Преимущество |
| Happy Horse 1.1 | 57% | Преимущество |
| Seedance 2.0 / Gemini Omni Flash | 52% | Близко к случайному выбору |
Техническая основа: Self-Flow
FLUX 3 построена на методе Self-Flow, который сочетает objective flow matching с самонадзором для реконструкции признаков. Архитектура использует SiT-XL/2 с по-токеновым таймстеп-условием. Обучение проходит с маской 25% на токен и самодистилляцией от учителя (EMA) на 20-м слое к студенту на 8-м. Важно отметить, что видео-генерация потребляет более 95% вычислительных ресурсов при обучении, тогда как на аудио приходится менее 0.5% токенов.
Робототехника и доступ
Одной из ключевых особенностей является способность модели предсказывать действия роботов. На базе FLUX 3 создана модель FLUX-mimic, работающая в реальном времени (менее 80 мс) на одной видеокарте RTX 5090. Доступ к видео- и action-модулям находится в стадии раннего доступа (Early Access), генерация изображений будет доступна позже, а открытые веса (open weights) появятся в последнюю очередь. Цены на коммерческое использование пока не опубликованы.
Источник: MarkTechPost ↗
