Суть оптимизации
Разработчик KingGore выпустил плагин ComfyUI_sol-attn_Blackwell, который внедряет алгоритм Sol-Attn (Sparsified On-the-fly Attention) в рабочий процесс генерации видео через MiniMax H3. Решение использует нативную поддержку flex_attention в PyTorch, которая компилируется в ядра уровня FlashAttention-3. Это позволяет избежать последовательных циклов и переполнения памяти (OOM), характерных для стандартных реализаций.
Ключевая особенность — работа с длинными последовательностями (>8k токенов), где традиционный механизм SDPA (Scaled Dot-Product Attention) становится узким местом. Плагин автоматически маршрутизирует запросы только к «важным» блокам KV-памяти, игнорируя шумные участки.
Производительность на RTX 5090
Тестирование проводилось на GPU NVIDIA RTX 5090 (архитектура SM120) с конфигурацией MiniMax H3 (H=56 heads, bfloat16, BTHD layout). Результаты демонстрируют экспоненциальный рост ускорения по мере увеличения длины последовательности:
| Длина последовательности | Время (SDPA) | Время (Sol-Attn) | Ускорение | Плотность (Density) |
|---|---|---|---|---|
| 4096 токенов | 2.35 мс | 1.61 мс | 1.46x | 0.15 |
| 8192 токенов | 9.24 мс | 2.35 мс | 3.93x | 0.11 |
| 16384 токенов | 36.47 мс | 5.28 мс | 6.91x | 0.09 |
| 32768 токенов | 144.5 мс | 16.06 мс | 9.00x | 0.08 |
Нововведения версии 2.0
Обновление v2 (август 2026) добавило два параметра, направленных на сохранение качества изображения и аудио, предложенных экспертом Kijai:
- dense_steps / step_off: Позволяет запускать последние шаги денуайзинга в плотном режиме (без разреженности). Поскольку на финальных этапах генерации шума мало, разреженные аппроксимации там видны сильнее. Установка
dense_steps=1убирает артефакты в деталях. - exact_kv / exact_kv_and_rows: Специфично для MiniMax H3. Гарантирует точное вычисление внимания для «префиксных» токенов (текст, условия, референсы и аудио-поток). Режим
exact_kv_and_rowsдобавляет ~20% к затратам, но делает сгенерированный аудио-стрим идеальным.
Технические требования и установка
Плагин кроссплатформенный (Windows, Linux, macOS), но требует строгого соблюдения аппаратных и программных условий:
- GPU: Только NVIDIA RTX 5090 (SM120) или другие потребительские GPU Blackwell. На картах H100/B200/RTX 40/30 серии работает только как стандартный SDPA (без ускорения).
- PyTorch: Версия ≥ 2.6 (тестировалась на 2.11.0+cu130).
- Установка: Клонирование репозитория в папку
ComfyUI/custom_nodes/. Установка pip не требуется, зависимости включены в PyTorch.
Первая генерация может занять 3–4 секунды на компиляцию ядра (torch.compile), после чего работает стабильно. Плагин имеет механизм автоматического падения (fallback) на Triton-референс или SDPA при ошибках, не прерывая процесс.
Источник: Github ↗
