Проблема позиционирования в видео-моделях
Современные видео-диффузионные трансформеры (Video DiT) обрабатывают токены на основе их позиции в пиксельно-временной сетке. Это означает, что модель знает, где находится токен в кадре, но не понимает его пространственного положения в мире. Камера пользователя задает фиксированный луч зрения, но сцена генерируется «с нуля», и модель часто путается в перспективе, особенно при сложных движениях камеры.
Решение SCoPE: луч как вторая координата
Метод SCoPE (Spatial Camera Position Encoding) вводит луч камеры как вторую позиционную координату для каждого токена. В отличие от стандартных подходов, где контроль камеры добавляется через дополнительные модули, здесь это свойство самой системы координат. Луч добавляется в запросы (queries) и ключи (keys) предварительно обученной модели внимания.
Ключевая инновация — использование взаимного произведения геометрии прямых (reciprocal product of line geometry). Эта метрика вычисляет, насколько близко две линии взгляда (от текущего и предыдущего кадров) пересекаются в пространстве. Если лучи сходятся, оценка внимания стремится к нулю, что помогает модели согласовывать объекты в разных кадрах.
Технические детали и эффективность
SCoPE использует механизм Normalize-Gate-Inject, который позволяет работать как с метрическими, так и с позициями «up-to-scale» (с неизвестным масштабом). Важнейшее преимущество — совместимость с существующими моделями:
- Метод не меняет битовое представление RoPE (Rotary Position Embedding).
- Начинается с неизученной предварительно обученной DiT.
- Добавляет менее 0.1% новых параметров.
Результаты на моделях Wan2.2
Эксперименты проводились на моделях Wan2.2 объемом 5B и 14B при сопоставимых данных и вычислительных бюджетах. SCoPE превосходит сильные базовые линии по всем метрикам контролируемости камеры и достоверности (fidelity). Разрыв в качестве увеличивается с ростом размера модели.
| Метрика | Модель | Улучшение (SCoPE vs Baseline) | Примечание |
|---|---|---|---|
| Ошибка вращения (Rotation Error) | 14B | Снижение на 29% | Более точное следование траектории камеры |
| FVD (Fréchet Video Distance) | 14B | Снижение на 43% | Значительно лучшее качество и плавность видео |
| Контролируемость камеры | 5B & 14B | Рост маржи | Маржа улучшений растет с размером модели |
Практическое применение
Метод демонстрирует стабильность на различных типах движений: от простых «Dolly In/Out» до сложных траекторий типа «S-Curve» и «Spiral Climb». SCoPE позволяет генерировать видео с реалистичной перспективой, где объекты не «скачут» и сохраняют пространственную целостность при движении камеры, что критично для создания кинематографичного контента и симуляций.
Источник: Github ↗
