Генерация видео с помощью искусственного интеллекта переживает взрывной рост, но за каждым впечатляющим кадром скрывается колоссальная вычислительная нагрузка. Архитектуры, известные как Video Diffusion Transformers (DiT), становятся стандартом индустрии благодаря своему качеству, однако их эффективность часто ограничена фундаментальными bottlenecks в процессе вычисления внимания (attention). Исследовательская группа Nunchux AI предлагает элегантное решение этой проблемы, представив VC-Attention — ядро внимания с низким битностью, которое не требует дообучения модели. Этот подход атакует сразу две критические проблемы: ошибки квантования значений (value quantization error) и медленный этап вычисления softmax, делая генерацию видео значительно быстрее без ущерба для визуальной fidelity.
В эпоху, когда видео-модели, такие как Wan2.2 или MiniMax-H3, требуют огромных ресурсов для обработки даже коротких клипов, оптимизация на уровне ядра CUDA становится не просто улучшением, а необходимостью. VC-Attention демонстрирует, как можно достичь ускорения в несколько раз на современном оборудовании, включая NVIDIA B200 и RTX 5090, используя инновационные методы квантования и замены вычислительных операций. Давайте разберемся, как именно работает эта технология и почему она может изменить ландшафт локального запуска видео-генераторов.
01Почему внимание (Attention) стало узким местом видео-генерации?
Чтобы понять масштаб проблемы, нужно заглянуть внутрь архитектуры Video DiT. В отличие от текстовых моделей, видео-модели должны обрабатывать пространственно-временные данные. Клип видео «сплющивается» в одну длинную последовательность пространственно-временных токенов (spatiotemporal tokens), и механизм полного само-внимания (full self-attention) применяется на каждом слое трансформера. Это вычислительно крайне затратная операция, сложность которой растет квадратично от количества токенов.
Возьмем для примера типичный сценарий: генерация 5-секундного видео в разрешении 720p с использованием модели Wan2.2-14B. Такая задача порождает около 70 000 токенов. На мощной видеокарте NVIDIA RTX 5090 вычисление внимания занимает более 64% всего времени генерации. Исследователи из Nunchux AI отмечают, что на еще более мощных серверных чипах, таких как NVIDIA B200, этап внимания составляет около двух третей каждого шага денормализации (denoising step) в модели MiniMax-H3. Это означает, что даже если мы оптимизируем остальные части нейросети, внимание останется главным тормозом, если не решить эту проблему на уровне ядра.
Современные GPU, такие как серия Blackwell (B200) или Hopper (H200), оснащены тензорными ядрами (Tensor Cores), которые отлично справляются с умножением матриц в низком битовом формате (low-bit). Однако здесь возникают два серьезных препятствия. Во-первых, предыдущие методы оптимизации, такие как SageAttention2, сглаживают запросы (queries) и ключи (keys). После этого сглаживания и поворота (rotation), основной источник ошибки в выходных данных — это сам термин значений (value term), на который приходится до 82% ошибки в модели Wan2.2. Во-вторых, операция softmax, которая происходит между умножениями матриц, все еще выполняется в формате FP32. На чипах B200 и H200 вычисление экспоненты и последующее приведение типов (cast) становятся самым длинным этапом в конвейере обработки, сводя на нет преимущества низкого битового формата.
02V-Smooth: Устранение выбросов в значениях (Value Outliers)
Первая инновация VC-Attention, названная V-Smooth, направлена на решение проблемы выбросов в значениях (value outliers). В видео-моделях выбросы сосредоточены в нескольких токенах, и их каналы могут меняться в зависимости от голов (heads), слоев и шагов генерации. Традиционные методы, использующие ротацию Хадамара (Hadamard rotation), сохраняют нормы токенов, но не удаляют выбросы, что приводит к значительным ошибкам. Поворот матрицы V изменяет ошибку значения всего на 0,2%, что недостаточно для качественной генерации.
Команда Nunchux AI предложила трехэтапный подход V-Smooth, который работает иначе:

- Группировка (Group): Используется онлайн-алгоритм k-means для кластеризации токенов значений (value tokens) в каждом батче и для каждой головы. Важно, что ключи и значения переставляются вместе, что гарантирует неизменность результата не-каузального внимания. Это позволяет безопасно группировать данные без искажения логики модели.
- Центрирование (Demean): Для каждого аппаратного блока из 128 токенов вычитается среднее значение. Квантованию подвергается только остаток (residual). Это позволяет использовать более агрессивное квантование, так как остаточные значения имеют меньший разброс. Применяется пер-канальное квантование E4M3 (8 бит) или NVFP4 (4 бита).
- Восстановление (Restore): Среднее значение добавляется обратно. Поскольку онлайн-softmax уже хранит сумму строк (row sum), нет необходимости во втором проходе или выделении дополнительного буфера памяти. Это экономит время и ресурсы VRAM.
Эффективность этого метода подтверждена цифрами. В среднем по 100 головам модели Wan2.2, вычитание среднего блока удаляет 8% энергии блока в порядке следования последовательности. При использовании статического куба DeltaQuant этот показатель возрастает до 12%, а после сортировки — до 36%. При этом стоимость вычисления среднего значения составляет всего 0,125 бита на элемент значения. Группировка запускается только на первых 25% шагов денормализации, а перестановка переиспользуется в течение 4 соседних шагов. В среднем по всему расписанию генерации, затраты на группировку составляют всего 3-4% от времени вычисления внимания.
03ExpCast-FP8: Устранение узкого места Softmax
Вторая часть оптимизации, ExpCast-FP8, решает проблему медленного этапа softmax. Стандартный процесс включает вычисление экспоненты в формате FP32, что является узким местом. Исследователи заметили, что байт в формате E4M3 уже близок к логарифму значения, которое он хранит. Если прочитать этот байт как целое число, он приблизительно равен 8 * log2(v) + 56.
На основе этого наблюдения был разработан метод ExpCast-FP8. Он записывает байт напрямую из логарифмической области счета (log-domain score) с помощью одной объединенной операции умножения и сложения (fused multiply-add). Константа β = -0.35 центрирует оставшуюся ошибку, и при этом не требуется подгонка констант под конкретную модель. Прямой путь записывает тот же байт, что и путь FP32 (экспонента затем приведение типов), в 79,6% случаев каждого удвоения диапазона. В остальных случаях он отличается всего на один код.
Математический анализ показывает, что общая вариация на строку (per-row total variation) составляет менее 3,64%, плюс хвосты недонаполнения (underflow tail). На практике, при тестировании на 204 800 строках внимания Wan2.2, средняя ошибка составила всего 1,6%. Важно отметить, что ExpCast-FP8 применяется только к 8-битному ядру, так как формат NVFP4 не имеет единого аффинного отображения от логарифма к коду.
04Реализация и производительность
Для достижения максимальной производительности команда Nunchux AI использовала ручную оптимизацию (hand-written) с использованием библиотек CuTe и CUDA. Это позволило слить этап предобработки в единое ядро. Результат впечатляет: вызов V-Smooth сократился с 42,2 мс до 4,8 мс на чипе B200. Это кратное ускорение预处理 (preprocessing) этапа позволяет ядру внимания работать на пределе возможностей GPU.

Бенчмарки проводились на четырех открытых видео-моделях DiT: Wan2.2-T2V-A14B, LongCat-Video, HunyuanVideo-1.5 и MiniMax-H3. Качество (fidelity) оценивалось по сравнению с выходами FlashAttention-4 в формате BF16 на основе 100 промптов. Результаты показывают значительное ускорение как на уровне самого внимания, так и в общем времени генерации (end-to-end speedup).
На видеокарте B200 с 8-битным форматом ускорение внимания составило 1,59x, а общее время генерации — 1,19x. На H200 эти показатели равны 1,46x и 1,13x соответственно. На рабочих станциях, таких как RTX PRO 6000, использование 4-битного формата дало ускорение внимания в 2,27x и общее ускорение в 1,36x. Самым впечатляющим результатом стало ускорение на RTX 5090: 3,58x для внимания и 1,70x для общей генерации. Это делает локальную генерацию видео высокого качества на потребительских картах значительно более доступной.
Сравнение с SageAttention2 показывает, что на B200 VC-Attention работает в 6,02 раза быстрее, так как SageAttention2 не имеет ядра для архитектуры Blackwell. На H200 разрыв составляет 1,16x. На рабочих картах 4-битный V-Smooth сопоставим с SageAttention3 на RTX PRO 6000 и остается в пределах 5% на RTX 5090, где различия в качестве (fidelity) становятся решающим фактором.
05Качество генерации: PSNR и визуальная fidelity
Скорость — это хорошо, но для видео-генерации критически важно качество. Результаты по качеству (PSNR) подтверждают эффективность метода. При 8-битном квантовании V-Smooth добавляет 2,3 дБ PSNR по сравнению с SageAttention2 на Wan2.2 и 2,8 дБ на HunyuanVideo-1.5. Добавление ExpCast-FP8 возвращает еще 0,7–2,1 дБ, что все равно превосходит SageAttention2 на всех четырех моделях.
При 4-битном квантовании V-Smooth превосходит SageAttention3 на 2,9 дБ на Wan2.2 и на 3,6 дБ на LongCat-Video. Для сравнения, метод Attn-QAT, который требует дообучения (training), отстает от SageAttention2 на 3,4–6,7 дБ. Это подчеркивает главное преимущество VC-Attention: оно работает «из коробки» (training-free), не требуя сложных и ресурсоемких процессов адаптации моделей.
На модели MiniMax-H3 при разрешении 1344x768 внимание работает в 1,60 раза быстрее, чем BF16 FlashAttention-4 на B200. PSNR составляет 20,2 дБ против 19,9 дБ для SageAttention2. На чипе B300 документация сообщает об ускорении 1,47x против 1,31x для наивного FP8-ядра. Проприетарное расширение Nunchux Attention достигает ускорения 1,91x на B200 и 1,83x на B300 для внимания в MiniMax-H3.

06Что это значит на практике
Для разработчиков и энтузиастов AI, VC-Attention открывает новые горизонты. Во-первых, это означает, что запуск тяжелых видео-моделей, таких как Wan2.2 или MiniMax-H3, становится возможным на более доступном оборудовании, таком как RTX 5090, с приемлемой скоростью. Ускорение в 1,7 раза по времени генерации может сократить ожидание с нескольких минут до менее чем минуты для коротких клипов.
Во-вторых, отсутствие необходимости в дообучении (training-free) делает технологию универсальной. Пользователи могут применять VC-Attention к существующим моделям без риска деградации качества, связанной с неправильной настройкой параметров квантования. Это снижает порог входа для использования передовых видео-генераторов.
В-третьих, проприетарный характер реализации на данный момент означает, что широкая публика не имеет прямого доступа к ядру. Однако Nunchux AI планирует предоставить бесплатный доступ к MiniMax-H3 через свой сервис Modelverse. Это может стать первым шагом к более широкому распространению технологии, когда оптимизации ядра станут стандартом для открытых видео-моделей.
В заключение, VC-Attention от Nunchux AI представляет собой значительный шаг вперед в оптимизации видео-трансформеров. Сочетание V-Smooth для устранения выбросов и ExpCast-FP8 для ускорения softmax позволяет достичь рекордных скоростей без потери качества. Хотя публичного релиза ядра пока нет, технические детали и результаты бенчмарков показывают, что этот подход может стать новым стандартом для эффективной генерации видео в ближайшие годы.
Для тех, кто хочет углубиться в технические детали, рекомендуется ознакомиться с оригинальной статьей и техническими спецификациями на сайте Nunchux AI. Эта работа демонстрирует, как глубокая оптимизация на уровне ядра может решить фундаментальные проблемы масштабируемости в области генеративного ИИ.
Источник: MarkTechPost ↗
