Проблема разрыва между текстом и изображением
В эпоху стремительного развития генеративного ИИ, таких как Sora, Runway Gen-2 и Pika, ключевой проблемой остается точность соответствия между текстовым промптом и сгенерированным видеорядом. Часто модели генерируют визуально привлекательные кадры, но они не соответствуют описанию в тексте. Это явление автор называет 'разрывом внимания' (attention gap).
Концепция Attention Triangle
Саги Полачек предлагает модель 'Attention Triangle', состоящую из трех вершин:
- Text (Текст): Текстовый промпт, описывающий сцену.
- Video (Видео): Визуальный контент, генерируемый моделью.
- Subject (Субъект): Конкретный визуальный объект или персонаж, который должен быть связан с текстом.
Цель модели — обеспечить прямую связь между текстовым описанием и визуальным субъектом, минуя промежуточные искажения.
Почему это важно?
Понимание 'Attention Triangle' помогает разработчикам фокусироваться не только на качестве генерации пикселей, но и на семантической точности. Это критически важно для создания видео, где конкретные объекты должны выполнять определенные действия, описанные в тексте.
Практическое применение
Исследование предлагает новые подходы к обучению моделей, позволяя им лучше 'понимать' связь между словами и визуальными элементами. Это может привести к созданию более контролируемых и точных видео-генераторов, способных создавать сложные сцены с множеством взаимодействующих объектов.
Источник: Github ↗
