Прорыв в скорости генерации видео
Лаборатория NV Labs представила Sol-Attn (Sparse and Optimized Linear Attention), новую архитектуру механизма внимания, интегрированную в видео-модель Sana. Главная цель разработки — устранение узкого места в вычислительной сложности при генерации длинных видеорядов. Традиционные механизмы внимания (Dense attention) требуют ресурсов, растущих квадратично от длины последовательности, что делает генерацию высококачественного видео ресурсоемкой задачей.
Sol-Attn заменяет стандартное плотное внимание на разреженную линейную аппроксимацию, что позволяет значительно сократить количество операций FLOPs. Результатом стало ускорение инференса в 1.9 раза по сравнению с базовым Dense attention при сохранении визуального качества.
Детали реализации и метрики
Технология демонстрирует эффективность на примере сложных кинематографичных сцен, требующих точной передачи освещения, текстуры кожи и движения камеры. В сравнении с базовым подходом, Sol-Attn сохраняет четкость лица (face-first composition) и естественность переходов света, что критично для генерации портретов.
| Метрика / Параметр | Dense Attention (Baseline) | Sol-Attn (NV Labs) |
|---|---|---|
| Скорость инференса | 1.00× | 1.90× |
| Тип механизма внимания | Полная матрица (O(N²)) | Разреженная линейная аппроксимация |
| Качество визуализации | Высокое | Высокое (сохранено) |
| Пример сценария | Кинематографичный портрет, 85mm | Кинематографичный портрет, 85mm |
Примеры генерации: сложность сцен
Для демонстрации возможностей Sol-Attn NV Labs привела примеры промптов, требующих высокой точности в передаче:
- Динамическое освещение: Горизонтальные полосы золотого солнечного света, медленно движущиеся по лицу актрисы в кадре с окном и шторами.
- Текстуры и детали: Естественные поры кожи, искрящаяся пыль в луче света от кинопроектора, мягкое размытие фона (bokeh).
- Сложные движения: Плавный поворот головы из профиля в три четверти, микро-выражения лица (subtle thoughtful smile), движение камеры (slow push-in).
Все примеры подчеркивают важность сохранения фокуса на лице (no hands near face, no text) и реалистичной звуковой атмосферы, которую модель учитывает при генерации визуального ряда.
Почему это важно
Ускорение в 1.9 раза — это существенный шаг к коммерциализации и широкому использованию видео-генерации в реальном времени. Снижение вычислительных затрат позволяет запускать более сложные модели на менее мощном оборудовании или увеличивать разрешение и длительность генерируемых роликов. Sol-Attn становится ключевым компонентом в экосистеме Sana, делая высококачественную видео-генерацию более доступной для разработчиков и креаторов.
Источник: Github ↗
