Релиз модели27 сентября 2026 г., 13:46 МСК🤖 Auto

Veda от ByteDance: ускорение генерации видео в 5 раз без потери качества

Исследователи из ByteDance, HKU и USTC представили Veda — метод разреженного внимания, который ускоряет генерацию видео в 5.1 раза, сохраняя визуальное качество на уровне плотного внимания.

Баннер новости 8366

Прорыв в скорости генерации видео

Команда разработала Veda — архитектуру, оптимизирующую процесс само-внимания (self-attention) в больших видео-моделях. Главная проблема генерации длинных видео — квадратичная сложность $O(N^2)$ при обработке пространственно-временных токенов. Veda решает это через 95% разреженность (sparsity) и аппаратно-ориентированное пропускание тайлов (tile skipping).

На модели Waver-T2V-12B (720P, 241 кадр) метод показал ускорение 5.1x по сравнению с базовой плотной реализацией FlashAttention-3. Время генерации сократилось с 19.4 минут до 3.8 минут, при этом качество изображения осталось неизменным.

Техническая суть: Структурная дистилляция

Veda не просто отбрасывает токены, а использует Attention Structure Distillation. «Учитель» (полное внимание) передает распределение геометрии внимания «ученику» через max-pooled supervision. Это позволяет сохранить важные пространственно-временные связи, избегая артефактов вроде «водной ряби» и мерцания, характерных для других методов разреженности.

Ключевые принципы:

  • Head-Conditioned Tile Geometry: Геометрия тайлов адаптируется под разные головы внимания внутри слоя.
  • Tile-Sparse Kernel: Ядро ThunderKittens использует TMA для выборочной загрузки K/V тайлов, накладывая сбор данных на вычисления WGMMA.

Результаты бенчмарков

Метод протестирован на наборах Waver-T2V и Wan2.1. В таблице ниже приведено сравнение задержки на слой (per-layer latency) для моделей разного размера и разрешения:

Модель / Конфигурация Разрешение / Длительность FlashAttention-3 (мс/слой) Veda (мс/слой) Ускорение
Waver-T2V-12B 720P, 121 кадр 315 78 4.03×
Waver-T2V-1B 480P, 121 кадр 66 26 2.57×
Wan2.1-T2V-14B 720P, 81 кадр 584 221 2.64×
Wan2.1-T2V-1.3B 480P, 81 кадр 37 21 1.76×

Сохранение качества: Human Evaluation

В слепом сравнении на датасете WaverBench1.0 (304 промптов) Veda с 90% разреженностью показала результаты, практически идентичные полному вниманию:

  • Визуальное предпочтение: 50% за Veda против 49% за полное внимание (ничья).
  • Сравнение с VSA@95%: Veda выигрывает в 76% случаев по визуальному качеству и в 39% случаев по общей оценке.

Доля вычислений, приходящаяся на внимание, снизилась с 92% до 50%, что делает модель значительно эффективнее для развертывания.

Источник: Github ↗