Инструменты6 августа 2026 г., 11:46 МСК🤖 Auto

MiniMax-H3 Turbo: генерация видео и звука за 4 шага

Разработчики представили LoRA-адаптер для модели MiniMax-H3, ускоряющий генерацию синхронизированного видео и стереозвука в 5 раз. Новый инструмент позволяет получать результат за 4 шага вместо стандартных 20.

Баннер новости 5200

Суть прорыва: ускорение без потери синхронизации

На платформе Hugging Face появился ранний прототип LoRA-модели MiniMax-H3 Turbo от разработчика Larryvrh. Главная особенность адаптера — способность генерировать совместное видео и синхронизированный стереозвук всего за 4 шага дискретизации. Это обеспечивает ускорение процесса примерно в 5 раз по сравнению со стандартным режимом работы базовой модели MiniMax-H3, которая обычно требует около 20 шагов.

Важно отметить, что текущая версия весов является early preview (ранним предварительным просмотром). Модель находится в стадии недообучения, поэтому качество пока не является продукционным. Однако даже на ранних этапах видно улучшение детализации и чистоты аудио по сравнению с базовой моделью при том же количестве шагов.

Технические детали и совместимость

Для работы адаптера критически важно использовать правильную конфигурацию. Базовая модель должна быть не обрезанной (non-pruned) — подходят варианты bf16 или полный int8_convrot DiT. Версии pruned_int8 и pruned_fp8 несовместимы, так как используют другой слой временной условности.

Адаптер интегрируется через кастомные ноды для ComfyUI. Поскольку видео и аудио в MiniMax-H3 работают на разных графиках потока (flow schedules), стандартный сэмpler ломает синхронизацию при 4 шагах. Требуется замена на специализированный MiniMax-H3 Turbo Sampler с расписанием simple на 4 шага.

Рекомендации по использованию и качеству

Хотя заявлено 4 шага, разработчики рекомендуют для достижения оптимальной резкости использовать диапазон 6–8 шагов. При 4 шагах изображение получается заметно мягче. Количество шагов ≥4 валидно, но качество растет с их увеличением.

Файл весов Шаги обучения Характеристики и рекомендации
minimax_h3_turbo_4step_ckpt500.safetensors ~500 Рекомендуемый дефолтный вариант. Самый новый, не-EMA, обеспечивает наибольшую резкость.
minimax_h3_turbo_4step_ema_ckpt500.safetensors ~500 Вариант с усреднением по времени. Более плавный, но на этом чекпоинте может давать сильные артефакты (ghosting) и смазывание движения.
minimax_h3_turbo_4step.safetensors ~200 Первый релиз, не-EMA. Снят с рекомендации в пользу ckpt500.
minimax_h3_turbo_4step_ema.safetensors ~200 Первый релиз, EMA. Устарел.

Параметры генерации и требования к железу

Модель поддерживает разрешение, кратное 32 пикселям, с короткой стороной обычно 768. Частота кадров — 24 fps, количество кадров подстраивается под сетку модели (17·k+5). Валидный диапазон: 124–362 кадра (эквивалентно 5–15 секундам видео).

Аудио генерируется в формате 32 kHz стерео и строго синхронизировано с видеорядом. Из-за большого размера базовой модели (~33 млрд параметров) требуется GPU с объемом VRAM около 80 ГБ. В скрипте generate.py доступна опция --offload-adaln, позволяющая перенести ~13 ГБ VRAM в оперативную память CPU.

Как запустить

Для использования доступен готовый JSON-workflow для ComfyUI или standalone-скрипт generate.py. Скрипт требует установки ComfyUI на конкретном коммите (14b0522) и загрузки базовых весов MiniMax-H3. Пример команды запуска:

python generate.py \
  --comfyui ./ComfyUI \
  --base models/diffusion_models/minimax_h3_fl2va_bf16.safetensors \
  --lora minimax_h3_turbo_4step_ckpt500.safetensors \
  --prompt "A corgi in a chef hat flipping a pancake" \
  --width 1344 --height 768 --frames 124 --out corgi.mp4

Разработчики предупреждают: это работа в процессе. Если что-то сломается, следует открывать issue в репозитории нод. Новые чекпоинты будут появляться по мере дообучения модели.

Источник: Huggingface ↗