Инструменты7 августа 2026 г., 21:45 МСК🤖 Auto

ComfyUI Sol-Attn: ускорение MiniMax H3 на RTX 5090 до 9x

Плагин Sol-Attn для ComfyUI реализует разреженное внимание (sparse attention) для видео-модели MiniMax H3 на архитектуре Blackwell, обеспечивая кратный прирост скорости генерации.

Баннер новости 5331

Суть оптимизации

Разработчик KingGore выпустил плагин ComfyUI_sol-attn_Blackwell, который внедряет алгоритм Sol-Attn (Sparsified On-the-fly Attention) в рабочий процесс генерации видео через MiniMax H3. Решение использует нативную поддержку flex_attention в PyTorch, которая компилируется в ядра уровня FlashAttention-3. Это позволяет избежать последовательных циклов и переполнения памяти (OOM), характерных для стандартных реализаций.

Ключевая особенность — работа с длинными последовательностями (>8k токенов), где традиционный механизм SDPA (Scaled Dot-Product Attention) становится узким местом. Плагин автоматически маршрутизирует запросы только к «важным» блокам KV-памяти, игнорируя шумные участки.

Производительность на RTX 5090

Тестирование проводилось на GPU NVIDIA RTX 5090 (архитектура SM120) с конфигурацией MiniMax H3 (H=56 heads, bfloat16, BTHD layout). Результаты демонстрируют экспоненциальный рост ускорения по мере увеличения длины последовательности:

Длина последовательности Время (SDPA) Время (Sol-Attn) Ускорение Плотность (Density)
4096 токенов 2.35 мс 1.61 мс 1.46x 0.15
8192 токенов 9.24 мс 2.35 мс 3.93x 0.11
16384 токенов 36.47 мс 5.28 мс 6.91x 0.09
32768 токенов 144.5 мс 16.06 мс 9.00x 0.08

Нововведения версии 2.0

Обновление v2 (август 2026) добавило два параметра, направленных на сохранение качества изображения и аудио, предложенных экспертом Kijai:

  • dense_steps / step_off: Позволяет запускать последние шаги денуайзинга в плотном режиме (без разреженности). Поскольку на финальных этапах генерации шума мало, разреженные аппроксимации там видны сильнее. Установка dense_steps=1 убирает артефакты в деталях.
  • exact_kv / exact_kv_and_rows: Специфично для MiniMax H3. Гарантирует точное вычисление внимания для «префиксных» токенов (текст, условия, референсы и аудио-поток). Режим exact_kv_and_rows добавляет ~20% к затратам, но делает сгенерированный аудио-стрим идеальным.

Технические требования и установка

Плагин кроссплатформенный (Windows, Linux, macOS), но требует строгого соблюдения аппаратных и программных условий:

  • GPU: Только NVIDIA RTX 5090 (SM120) или другие потребительские GPU Blackwell. На картах H100/B200/RTX 40/30 серии работает только как стандартный SDPA (без ускорения).
  • PyTorch: Версия ≥ 2.6 (тестировалась на 2.11.0+cu130).
  • Установка: Клонирование репозитория в папку ComfyUI/custom_nodes/. Установка pip не требуется, зависимости включены в PyTorch.

Первая генерация может занять 3–4 секунды на компиляцию ядра (torch.compile), после чего работает стабильно. Плагин имеет механизм автоматического падения (fallback) на Triton-референс или SDPA при ошибках, не прерывая процесс.

Источник: Github ↗