Инструменты17 сентября 2026 г., 15:46 МСК🤖 Auto

Nunchux представила VC-Attention: ускорение видео-генерации в 1.9x без дообучения

Команда Nunchux представила метод VC-Attention, который ускоряет вычисление внимания в видео-моделях на NVIDIA B200/B300 почти вдвое, сохраняя качество на уровне BF16.

Баннер новости 7713

Проблема: внимание — узкое место видео-генерации

Генерация видео требует огромных вычислительных ресурсов, так как стоимость операции внимания (attention) растет квадратично от количества токенов. На чипах NVIDIA B200 и B300 до двух третей времени каждого шага денормализации (denoising step) уходит именно на вычисление внимания. Стандартные методы квантования (например, Attn-QAT) ускоряют процесс, но часто жертвуют качеством изображения, а операция softmax остается узким местом, выполняясь в высокой точности (FP32).

Решение: VC-Attention без дообучения

Nunchux представила VC-Attention — метод низкоразрядного внимания, который не требует переобучения моделей. Он сочетает две инновации:

  • V-Smooth: Алгоритм сглаживания значений (values). Вместо случайной группировки токенов, метод использует легковесный k-means для объединения схожих токенов в блоки. Из каждого блока вычитается среднее значение (которое хранится точно), а квантуется только остаток. Это снижает ошибку квантования и повышает PSNR.
  • ExpCast-FP8: Замена медленной операции экспоненцирования в softmax на линейное приближение. Вместо вычисления $p = 2^z$ в FP32 и последующего приведения к формату E4M3, метод напрямую вычисляет байт кода E4M3 за одну операцию FMA (Fused Multiply-Add). Это устраняет bottleneck высокой точности.

Результаты бенчмарков

Тестирование проводилось на модели MiniMax-H3 при генерации 243 кадров в разрешении 1344×768. Результаты показывают ускорение относительно базовой линии BF16 FlashAttention-4:

Kernel / Метод Ускорение на NVIDIA B200 Ускорение на NVIDIA B300
FlashAttention-4 (BF16, база) 1.00× 1.00×
Attn-QAT (QK4 · PV8) 1.40× 1.34×
SageAttention2 (8-bit)
VC-Attention (8-bit + ExpCast-FP8) 1.59× 1.51×
Nunchux Attention (проприетарное расширение) 1.91× 1.83×

По качеству (PSNR) VC-Attention показывает 20.2 dB против 19.9 dB у SageAttention2, что означает большую близость к оригинальному выводу в BF16.

Почему это важно

Ускорение в 1.9x на B200 делает генерацию длинных и высококачественных видео значительно более доступной по стоимости и времени. Метод совместим с существующими архитектурами (Sparse Attention, few-step distillation) и позволяет запускать более сложные модели на том же оборудовании. Nunchux планирует интегрировать VC-Attention в свой стек инференса и скоро откроет доступ к модели MiniMax-H3 через платформу Modelverse.

Источник: Nunchux ↗