Релиз модели3 августа 2026 г., 11:45 МСК🤖 Auto

NV Labs представила Sol-Attn: 1.9x ускорение видео-генерации

NV Labs выпустила Sol-Attn — оптимизированный механизм внимания для видео-модели Sana, обеспечивающий 1.9-кратное ускорение инференса без потери качества кинематографичных портретов.

Баннер новости 4940

Прорыв в скорости генерации видео

Лаборатория NV Labs представила Sol-Attn (Sparse and Optimized Linear Attention), новую архитектуру механизма внимания, интегрированную в видео-модель Sana. Главная цель разработки — устранение узкого места в вычислительной сложности при генерации длинных видеорядов. Традиционные механизмы внимания (Dense attention) требуют ресурсов, растущих квадратично от длины последовательности, что делает генерацию высококачественного видео ресурсоемкой задачей.

Sol-Attn заменяет стандартное плотное внимание на разреженную линейную аппроксимацию, что позволяет значительно сократить количество операций FLOPs. Результатом стало ускорение инференса в 1.9 раза по сравнению с базовым Dense attention при сохранении визуального качества.

Детали реализации и метрики

Технология демонстрирует эффективность на примере сложных кинематографичных сцен, требующих точной передачи освещения, текстуры кожи и движения камеры. В сравнении с базовым подходом, Sol-Attn сохраняет четкость лица (face-first composition) и естественность переходов света, что критично для генерации портретов.

Метрика / Параметр Dense Attention (Baseline) Sol-Attn (NV Labs)
Скорость инференса 1.00× 1.90×
Тип механизма внимания Полная матрица (O(N²)) Разреженная линейная аппроксимация
Качество визуализации Высокое Высокое (сохранено)
Пример сценария Кинематографичный портрет, 85mm Кинематографичный портрет, 85mm

Примеры генерации: сложность сцен

Для демонстрации возможностей Sol-Attn NV Labs привела примеры промптов, требующих высокой точности в передаче:

  • Динамическое освещение: Горизонтальные полосы золотого солнечного света, медленно движущиеся по лицу актрисы в кадре с окном и шторами.
  • Текстуры и детали: Естественные поры кожи, искрящаяся пыль в луче света от кинопроектора, мягкое размытие фона (bokeh).
  • Сложные движения: Плавный поворот головы из профиля в три четверти, микро-выражения лица (subtle thoughtful smile), движение камеры (slow push-in).

Все примеры подчеркивают важность сохранения фокуса на лице (no hands near face, no text) и реалистичной звуковой атмосферы, которую модель учитывает при генерации визуального ряда.

Почему это важно

Ускорение в 1.9 раза — это существенный шаг к коммерциализации и широкому использованию видео-генерации в реальном времени. Снижение вычислительных затрат позволяет запускать более сложные модели на менее мощном оборудовании или увеличивать разрешение и длительность генерируемых роликов. Sol-Attn становится ключевым компонентом в экосистеме Sana, делая высококачественную видео-генерацию более доступной для разработчиков и креаторов.

Источник: Github ↗