Прорыв в скорости генерации видео
Команда разработала Veda — архитектуру, оптимизирующую процесс само-внимания (self-attention) в больших видео-моделях. Главная проблема генерации длинных видео — квадратичная сложность $O(N^2)$ при обработке пространственно-временных токенов. Veda решает это через 95% разреженность (sparsity) и аппаратно-ориентированное пропускание тайлов (tile skipping).
На модели Waver-T2V-12B (720P, 241 кадр) метод показал ускорение 5.1x по сравнению с базовой плотной реализацией FlashAttention-3. Время генерации сократилось с 19.4 минут до 3.8 минут, при этом качество изображения осталось неизменным.
Техническая суть: Структурная дистилляция
Veda не просто отбрасывает токены, а использует Attention Structure Distillation. «Учитель» (полное внимание) передает распределение геометрии внимания «ученику» через max-pooled supervision. Это позволяет сохранить важные пространственно-временные связи, избегая артефактов вроде «водной ряби» и мерцания, характерных для других методов разреженности.
Ключевые принципы:
- Head-Conditioned Tile Geometry: Геометрия тайлов адаптируется под разные головы внимания внутри слоя.
- Tile-Sparse Kernel: Ядро ThunderKittens использует TMA для выборочной загрузки K/V тайлов, накладывая сбор данных на вычисления WGMMA.
Результаты бенчмарков
Метод протестирован на наборах Waver-T2V и Wan2.1. В таблице ниже приведено сравнение задержки на слой (per-layer latency) для моделей разного размера и разрешения:
| Модель / Конфигурация | Разрешение / Длительность | FlashAttention-3 (мс/слой) | Veda (мс/слой) | Ускорение |
|---|---|---|---|---|
| Waver-T2V-12B | 720P, 121 кадр | 315 | 78 | 4.03× |
| Waver-T2V-1B | 480P, 121 кадр | 66 | 26 | 2.57× |
| Wan2.1-T2V-14B | 720P, 81 кадр | 584 | 221 | 2.64× |
| Wan2.1-T2V-1.3B | 480P, 81 кадр | 37 | 21 | 1.76× |
Сохранение качества: Human Evaluation
В слепом сравнении на датасете WaverBench1.0 (304 промптов) Veda с 90% разреженностью показала результаты, практически идентичные полному вниманию:
- Визуальное предпочтение: 50% за Veda против 49% за полное внимание (ничья).
- Сравнение с VSA@95%: Veda выигрывает в 76% случаев по визуальному качеству и в 39% случаев по общей оценке.
Доля вычислений, приходящаяся на внимание, снизилась с 92% до 50%, что делает модель значительно эффективнее для развертывания.
Источник: Github ↗
