Исследования5 сентября 2026 г., 00:18 МСК🤖 Auto

Аудио-видео модели: как «перекрестное внимание» ломает семантику

Исследование arXiv:2609.03586 раскрывает механизм «семантической утечки» в мультимодальных диффузионных моделях, где аудио и видео взаимно искажают друг друга из-за скрытых предубеждений.

Баннер новости 6812

Суть проблемы: треугольник внимания

Авторы работы (Sagi Polaczek, Noa Kraicer, Gal Metzer и др.) проанализировали архитектуру аудио-видео диффузионных моделей, выявив критический дефект в механизме cross-modal attention (перекрестного внимания). Модель обрабатывает три потока: текст, звук и видео, соединенных в так называемый «треугольник внимания». Оказалось, что этот механизм не просто координирует контент, но и создает систематические ошибки — семантическую утечку (semantic leakage).

Двустороннее влияние и предубеждения

Ключевое открытие исследования: связь между аудио и видео является двусторонней. Звук влияет на генерацию изображения, но и изображение влияет на генерацию звука. Эта связь формируется смещениями (biases), закодированными в параметрах модели. Когда текстовый промпт противоречит этим внутренним предубеждениям, модель игнорирует инструкцию пользователя и перенаправляет семантику к «визуально каноничным», но неверным результатам.

Методология: диагностика через сигналы внимания

Исследователи извлекли специфические сигналы, производные от механизма внимания, чтобы отследить, как именно семантика распределяется между модальностями. Эти сигналы используются как диагностический инструмент для:

  • Анализа внутренних динамик маршрутизации данных.
  • Изоляции роли отдельных взаимодействий.
  • Контролируемого вызова утечек для тестирования.

Результаты и улучшения

На основе извлеченных сигналов авторы разработали вмешательства на этапе инференса (inference-time interventions). Эти методы позволяют принудительно выравнивать кросс-модальные связи, что приводит к более точному соответствию текста, звука и видео. Эксперименты подтверждают, что качество генерации сохраняется, а семантическая точность значительно возрастает.

Компонент Роль в модели Выявленная проблема
Текст (Text) Основной условный сигнал (prompt) Игнорируется при конфликте с визуальными приоритетами
Аудио (Audio) Генерация звукового ряда Искажается под влиянием визуальных паттернов видео
Видео (Video) Генерация визуального ряда Искажается под влиянием звуковых паттернов аудио
Перекрестное внимание Координация потоков Источник «семантической утечки» и двустороннего влияния

Значение для индустрии

Работа демонстрирует, что артефакты в мультимодальных моделях возникают не только из-за размытия внимания, но и из-за структурированных, управляемых предубеждениями взаимодействий. Предложенный метод диагностики и коррекции открывает путь к созданию более надежных систем для создания синхронизированного аудио-видео контента.

Источник: arXiv cs.AI ↗