Инструменты14 августа 2026 г., 15:45 МСК🤖 Auto

ComfyUI-MiniMax-H3-LongMedia: Генерация 15-секундных видео на 16 ГБ VRAM

Выпущен v0.3.11 для работы с моделью MiniMax H3: оптимизация памяти позволяет генерировать 1080p видео на потребительских GPU, а аудио-режимы решают проблему артефактов синхронизации.

Баннер новости 5800

Решение проблемы VRAM для длинных последовательностей

Проект ComfyUI-MiniMax-H3-LongMedia (ранее LatentLab) представил версию v0.3.11, ставшую новым базовым стандартом для работы с моделью MiniMax H3. Главная инновация — гранулярная настройка потребления памяти для видеокарт с 8–12 ГБ VRAM. Теперь пользователи могут тонко настраивать токены и чанки с шагом в 512 единиц, а управление резервом VRAM — с шагом 128–256 МБ, не ломая совместимость старых рабочих процессов.

Ключевые параметры для ручной настройки (Manual Mode) теперь доступны с высокой точностью:

ПараметрШаг настройкиНазначение
mlp_chunk_tokens512 токеновЧанкинг MLP-слоя для снижения пиковой нагрузки
sol_qkv_chunk_tokens512 токеновПотоковая обработка QKV-проекции
vram_activation_reserve_mb256 МБРезерв памяти для активаций
inter_block_guard_emergency_mb128 МБЭкстренный guard для предотвращения OOM

Аудио-стратегия: сохранение ритма без артефактов

Особое внимание уделено синхронизации аудио и видео. Введен режим audio_mode=preserve_reference, который использует входной аудиотрек как условие для модели (ритм, тайминг, lip-sync), но после сэмплирования заменяет сгенерированный звук на оригинальный. Это устраняет артефакты реконструкции Turbo-LoRA, сохраняя при этом визуальную привязку к звуку.

  • preserve: Восстановление оригинального трека без использования его как референса для генерации.
  • reference_only: Использование референса для условий, но вывод сгенерированного звука H3.

Режимы работы и производительность

Интерфейс упрощен до трех основных нод: Setup, Sampler и Decode. Доступны четыре режима работы (workflow_mode), где hybrid_auto рекомендован для большинства задач. В этом режиме первый кадр становится началом, второй — концом, а остальные — референсами.

Тестирование показало, что конфигурация с активированным Dynamic VRAM позволяет выполнить 15-секундную генерацию видео 1920×1088 за 8 шагов на GPU с 16 ГБ памяти. Это достигается за счет потоковой обработки K/V (INT8 + scale) и сжатия скрытых представлений, избегая полных FP32-аллокаций.

Технические детали и установка

Для стабильной работы рекомендуется использовать режим внимания sol или scheduled_sol, которые включают встроенный путь Sol-Attn с адаптивным повторным запуском при нехватке памяти (OOM retry ladder). Установка осуществляется стандартным способом через ComfyUI/custom_nodes/. Важно: флаг --disable-dynamic-vram использовать нельзя.

Пример безопасной конфигурации для 16 ГБ VRAM включает mlp_chunk_tokens=24576 и vram_activation_reserve_mb=4096, что обеспечивает баланс между скоростью и стабильностью.

Источник: Github ↗