Суть прорыва: ускорение без потери синхронизации
На платформе Hugging Face появился ранний прототип LoRA-модели MiniMax-H3 Turbo от разработчика Larryvrh. Главная особенность адаптера — способность генерировать совместное видео и синхронизированный стереозвук всего за 4 шага дискретизации. Это обеспечивает ускорение процесса примерно в 5 раз по сравнению со стандартным режимом работы базовой модели MiniMax-H3, которая обычно требует около 20 шагов.
Важно отметить, что текущая версия весов является early preview (ранним предварительным просмотром). Модель находится в стадии недообучения, поэтому качество пока не является продукционным. Однако даже на ранних этапах видно улучшение детализации и чистоты аудио по сравнению с базовой моделью при том же количестве шагов.
Технические детали и совместимость
Для работы адаптера критически важно использовать правильную конфигурацию. Базовая модель должна быть не обрезанной (non-pruned) — подходят варианты bf16 или полный int8_convrot DiT. Версии pruned_int8 и pruned_fp8 несовместимы, так как используют другой слой временной условности.
Адаптер интегрируется через кастомные ноды для ComfyUI. Поскольку видео и аудио в MiniMax-H3 работают на разных графиках потока (flow schedules), стандартный сэмpler ломает синхронизацию при 4 шагах. Требуется замена на специализированный MiniMax-H3 Turbo Sampler с расписанием simple на 4 шага.
Рекомендации по использованию и качеству
Хотя заявлено 4 шага, разработчики рекомендуют для достижения оптимальной резкости использовать диапазон 6–8 шагов. При 4 шагах изображение получается заметно мягче. Количество шагов ≥4 валидно, но качество растет с их увеличением.
| Файл весов | Шаги обучения | Характеристики и рекомендации |
|---|---|---|
minimax_h3_turbo_4step_ckpt500.safetensors |
~500 | Рекомендуемый дефолтный вариант. Самый новый, не-EMA, обеспечивает наибольшую резкость. |
minimax_h3_turbo_4step_ema_ckpt500.safetensors |
~500 | Вариант с усреднением по времени. Более плавный, но на этом чекпоинте может давать сильные артефакты (ghosting) и смазывание движения. |
minimax_h3_turbo_4step.safetensors |
~200 | Первый релиз, не-EMA. Снят с рекомендации в пользу ckpt500. |
minimax_h3_turbo_4step_ema.safetensors |
~200 | Первый релиз, EMA. Устарел. |
Параметры генерации и требования к железу
Модель поддерживает разрешение, кратное 32 пикселям, с короткой стороной обычно 768. Частота кадров — 24 fps, количество кадров подстраивается под сетку модели (17·k+5). Валидный диапазон: 124–362 кадра (эквивалентно 5–15 секундам видео).
Аудио генерируется в формате 32 kHz стерео и строго синхронизировано с видеорядом. Из-за большого размера базовой модели (~33 млрд параметров) требуется GPU с объемом VRAM около 80 ГБ. В скрипте generate.py доступна опция --offload-adaln, позволяющая перенести ~13 ГБ VRAM в оперативную память CPU.
Как запустить
Для использования доступен готовый JSON-workflow для ComfyUI или standalone-скрипт generate.py. Скрипт требует установки ComfyUI на конкретном коммите (14b0522) и загрузки базовых весов MiniMax-H3. Пример команды запуска:
python generate.py \
--comfyui ./ComfyUI \
--base models/diffusion_models/minimax_h3_fl2va_bf16.safetensors \
--lora minimax_h3_turbo_4step_ckpt500.safetensors \
--prompt "A corgi in a chef hat flipping a pancake" \
--width 1344 --height 768 --frames 124 --out corgi.mp4
Разработчики предупреждают: это работа в процессе. Если что-то сломается, следует открывать issue в репозитории нод. Новые чекпоинты будут появляться по мере дообучения модели.
Источник: Huggingface ↗
