Суть проблемы: треугольник внимания
Авторы работы (Sagi Polaczek, Noa Kraicer, Gal Metzer и др.) проанализировали архитектуру аудио-видео диффузионных моделей, выявив критический дефект в механизме cross-modal attention (перекрестного внимания). Модель обрабатывает три потока: текст, звук и видео, соединенных в так называемый «треугольник внимания». Оказалось, что этот механизм не просто координирует контент, но и создает систематические ошибки — семантическую утечку (semantic leakage).
Двустороннее влияние и предубеждения
Ключевое открытие исследования: связь между аудио и видео является двусторонней. Звук влияет на генерацию изображения, но и изображение влияет на генерацию звука. Эта связь формируется смещениями (biases), закодированными в параметрах модели. Когда текстовый промпт противоречит этим внутренним предубеждениям, модель игнорирует инструкцию пользователя и перенаправляет семантику к «визуально каноничным», но неверным результатам.
Методология: диагностика через сигналы внимания
Исследователи извлекли специфические сигналы, производные от механизма внимания, чтобы отследить, как именно семантика распределяется между модальностями. Эти сигналы используются как диагностический инструмент для:
- Анализа внутренних динамик маршрутизации данных.
- Изоляции роли отдельных взаимодействий.
- Контролируемого вызова утечек для тестирования.
Результаты и улучшения
На основе извлеченных сигналов авторы разработали вмешательства на этапе инференса (inference-time interventions). Эти методы позволяют принудительно выравнивать кросс-модальные связи, что приводит к более точному соответствию текста, звука и видео. Эксперименты подтверждают, что качество генерации сохраняется, а семантическая точность значительно возрастает.
| Компонент | Роль в модели | Выявленная проблема |
|---|---|---|
| Текст (Text) | Основной условный сигнал (prompt) | Игнорируется при конфликте с визуальными приоритетами |
| Аудио (Audio) | Генерация звукового ряда | Искажается под влиянием визуальных паттернов видео |
| Видео (Video) | Генерация визуального ряда | Искажается под влиянием звуковых паттернов аудио |
| Перекрестное внимание | Координация потоков | Источник «семантической утечки» и двустороннего влияния |
Значение для индустрии
Работа демонстрирует, что артефакты в мультимодальных моделях возникают не только из-за размытия внимания, но и из-за структурированных, управляемых предубеждениями взаимодействий. Предложенный метод диагностики и коррекции открывает путь к созданию более надежных систем для создания синхронизированного аудио-видео контента.
Источник: arXiv cs.AI ↗
