Проблема: внимание — узкое место видео-генерации
Генерация видео требует огромных вычислительных ресурсов, так как стоимость операции внимания (attention) растет квадратично от количества токенов. На чипах NVIDIA B200 и B300 до двух третей времени каждого шага денормализации (denoising step) уходит именно на вычисление внимания. Стандартные методы квантования (например, Attn-QAT) ускоряют процесс, но часто жертвуют качеством изображения, а операция softmax остается узким местом, выполняясь в высокой точности (FP32).
Решение: VC-Attention без дообучения
Nunchux представила VC-Attention — метод низкоразрядного внимания, который не требует переобучения моделей. Он сочетает две инновации:
- V-Smooth: Алгоритм сглаживания значений (values). Вместо случайной группировки токенов, метод использует легковесный k-means для объединения схожих токенов в блоки. Из каждого блока вычитается среднее значение (которое хранится точно), а квантуется только остаток. Это снижает ошибку квантования и повышает PSNR.
- ExpCast-FP8: Замена медленной операции экспоненцирования в softmax на линейное приближение. Вместо вычисления $p = 2^z$ в FP32 и последующего приведения к формату E4M3, метод напрямую вычисляет байт кода E4M3 за одну операцию FMA (Fused Multiply-Add). Это устраняет bottleneck высокой точности.
Результаты бенчмарков
Тестирование проводилось на модели MiniMax-H3 при генерации 243 кадров в разрешении 1344×768. Результаты показывают ускорение относительно базовой линии BF16 FlashAttention-4:
| Kernel / Метод | Ускорение на NVIDIA B200 | Ускорение на NVIDIA B300 |
|---|---|---|
| FlashAttention-4 (BF16, база) | 1.00× | 1.00× |
| Attn-QAT (QK4 · PV8) | 1.40× | 1.34× |
| SageAttention2 (8-bit) | — | — |
| VC-Attention (8-bit + ExpCast-FP8) | 1.59× | 1.51× |
| Nunchux Attention (проприетарное расширение) | 1.91× | 1.83× |
По качеству (PSNR) VC-Attention показывает 20.2 dB против 19.9 dB у SageAttention2, что означает большую близость к оригинальному выводу в BF16.
Почему это важно
Ускорение в 1.9x на B200 делает генерацию длинных и высококачественных видео значительно более доступной по стоимости и времени. Метод совместим с существующими архитектурами (Sparse Attention, few-step distillation) и позволяет запускать более сложные модели на том же оборудовании. Nunchux планирует интегрировать VC-Attention в свой стек инференса и скоро откроет доступ к модели MiniMax-H3 через платформу Modelverse.
Источник: Nunchux ↗
