Инструменты4 августа 2026 г., 13:45 МСК🤖 Auto

ComfyUI: Ускорение MiniMax H3 через спектральное прогнозирование

Новый кастомный узел ComfyUI-Spectrum-MiniMax-H3 снижает нагрузку на трансформер MiniMax H3, прогнозируя скрытые признаки, что позволяет сократить количество вычислений на 30-35% без потери качества.

Баннер новости 5035

Суть оптимизации: от трансформеров к Chebyshev

Разработчик xmarre представил узел ComfyUI-Spectrum-MiniMax-H3, который интегрируется в нативную модель MiniMax H3 (audio-video). Метод использует спектральное прогнозирование признаков: вместо полного прохода через тяжелые блоки H3-трансформера на каждом шаге сэмплирования, система обучает модель гребневой регрессии Чебышева (Chebyshev ridge model) на основе фактических скрытых признаков после последнего блока трансформера.

Это позволяет прогнозировать признаки для будущих шагов, пропуская вычисление RoPE, проекций условий и референсных вложений. При этом выходные головы (audio/video reconstruction) и маппинг сигмы продолжают работать нативно на каждом шаге, обеспечивая совместимость структуры данных.

Производительность и бенчмарки

Оптимизация работает только с конкретными сэмплерами, которые делают один вызов predict_noise на итерацию. Анцестральные сэмплеры (с шумом) не поддерживаются, так как они нарушают детерминированную траекторию признаков. Ниже приведены результаты сокращения шагов трансформера для 20-шагового генерации:

Сэмплер Нативные шаги H3 Прогнозируемые шаги Сокращение вычислений
Euler 13 5, 7, 9, 11, 13, 15, 17 35%
RES multistep / CFG++ 14 5, 7, 9, 11, 13, 15 30%

Важно отметить: реальное ускорение по времени (wall-clock speedup) зависит от множества факторов, включая стоимость вывода голов, переносы CPU, размер латентов и аппаратное обеспечение. Сокращение касается именно шагов решения (solver steps), а не общего времени генерации.

Требования и совместимость

Узел требует строгой версии ComfyUI. Поддерживается только коммит e377e263049f9338b4d12a3dd417b36ae62948ff от 3 августа 2026 года (или новее, но не проверено), так как требуется API outer_sample с аргументом latent_shapes. Старые ревизии не поддерживаются. Узел не имеет сторонних Python-зависимостей, используя только PyTorch и модули ComfyUI.

Управление памятью и параметры

Архитектура минимизирует потребление VRAM, храня только max_history снимков скрытых признаков. В примере с разрешением 0.5 MP (27k строк аудио/видео, ширина 5376, 16-bit) при max_history=8 потребление составляет около 2.22–2.27 GiB. Для более высокого разрешения (1344x768, 124 кадра) объем может достигать 6.1 GiB при хранении в VRAM.

Ключевые параметры для настройки баланса «качество/скорость»:

  • blend_weight: доля спектрального прогноза (по умолчанию 0.50). Агрессивный пресет предлагает 0.75.
  • warmup_steps: начальные шаги, обязательные для нативного вычисления (по умолчанию 5).
  • history_storage: выбор между system_ram и vram для хранения истории признаков.

Установка осуществляется клонированием репозитория в ComfyUI/custom_nodes. После перезапуска узел доступен в разделе sampling/spectrum как Spectrum Apply MiniMax H3.

Источник: Github ↗