Релиз модели14 августа 2026 г., 11:45 МСК🤖 Auto

SCoPE: Контроль камеры в видео-моделях без переобучения

Исследователи представили SCoPE — метод, добавляющий геометрическую осознанность в Video Diffusion Transformers. Решение улучшает контроль камеры и качество видео с минимальными изменениями архитектуры.

Баннер новости 5785

Проблема позиционирования в видео-моделях

Современные видео-диффузионные трансформеры (Video DiT) обрабатывают токены на основе их позиции в пиксельно-временной сетке. Это означает, что модель знает, где находится токен в кадре, но не понимает его пространственного положения в мире. Камера пользователя задает фиксированный луч зрения, но сцена генерируется «с нуля», и модель часто путается в перспективе, особенно при сложных движениях камеры.

Решение SCoPE: луч как вторая координата

Метод SCoPE (Spatial Camera Position Encoding) вводит луч камеры как вторую позиционную координату для каждого токена. В отличие от стандартных подходов, где контроль камеры добавляется через дополнительные модули, здесь это свойство самой системы координат. Луч добавляется в запросы (queries) и ключи (keys) предварительно обученной модели внимания.

Ключевая инновация — использование взаимного произведения геометрии прямых (reciprocal product of line geometry). Эта метрика вычисляет, насколько близко две линии взгляда (от текущего и предыдущего кадров) пересекаются в пространстве. Если лучи сходятся, оценка внимания стремится к нулю, что помогает модели согласовывать объекты в разных кадрах.

Технические детали и эффективность

SCoPE использует механизм Normalize-Gate-Inject, который позволяет работать как с метрическими, так и с позициями «up-to-scale» (с неизвестным масштабом). Важнейшее преимущество — совместимость с существующими моделями:

  • Метод не меняет битовое представление RoPE (Rotary Position Embedding).
  • Начинается с неизученной предварительно обученной DiT.
  • Добавляет менее 0.1% новых параметров.

Результаты на моделях Wan2.2

Эксперименты проводились на моделях Wan2.2 объемом 5B и 14B при сопоставимых данных и вычислительных бюджетах. SCoPE превосходит сильные базовые линии по всем метрикам контролируемости камеры и достоверности (fidelity). Разрыв в качестве увеличивается с ростом размера модели.

Метрика Модель Улучшение (SCoPE vs Baseline) Примечание
Ошибка вращения (Rotation Error) 14B Снижение на 29% Более точное следование траектории камеры
FVD (Fréchet Video Distance) 14B Снижение на 43% Значительно лучшее качество и плавность видео
Контролируемость камеры 5B & 14B Рост маржи Маржа улучшений растет с размером модели

Практическое применение

Метод демонстрирует стабильность на различных типах движений: от простых «Dolly In/Out» до сложных траекторий типа «S-Curve» и «Spiral Climb». SCoPE позволяет генерировать видео с реалистичной перспективой, где объекты не «скачут» и сохраняют пространственную целостность при движении камеры, что критично для создания кинематографичного контента и симуляций.

Источник: Github ↗