Суть проблемы: «Приоритет поздних слоев»
Команда исследователей из Университета Карнеги-Меллона и других институтов провела аудит аудио-визуальных больших языковых моделей (AV-LLM). Они использовали бенчмарк AVHBench, где модели необходимо было определить, соответствуют ли аудиодорожка и видеоряд друг другу. Ключевой тест — это cross-modal conflict (конфликт модальностей): когда звук и видео синхронизированы, но семантически несовместимы (например, видео с собакой, а звук — лай кошки).
Результаты оказались катастрофическими. Модели не просто ошибались, они демонстрировали паттерн "prior dominance" (доминирование априорного знания). Это означает, что на поздних этапах обработки нейросеть игнорирует входящие данные и опирается на внутренние статистические паттерны, к которым она была «запрограммирована» при обучении.
Цифры и метрики провала
Исследование выявило конкретные цифры падения эффективности для двух популярных архитектур:
| Модель | Падение точности при конфликте | Проблемы с инструкциями | Уровень точности (Exact-String) |
|---|---|---|---|
| VideoLLaMA 2-7B-AV | Информация недостаточна | Информация недостаточна | Близко к уровню случайного угадывания (50%) |
| InternVideo2 | -32.3% | -17.3% | Значительное снижение |
Для InternVideo2 падение точности на 32.3% является критическим. Более того, 17.3% случаев сопровождались полным отказом от следования инструкции, что указывает на глубокую нестабильность модели в стрессовых условиях.
Механистический анализ: где ломается логика
Авторы провели анализ интерпретируемости (mechanistic interpretability), чтобы понять, на каком именно этапе происходит сбой. Выяснилось, что «принятие решения» (commitment) концентрируется в 25.5 ± 1 слоях нейросети. Именно здесь модель фиксирует ответ, основываясь на внутреннем приоритете, а не на актуальных визуальных или аудиальных сигналах.
Почему это важно
Результаты показывают, что текущие AV-LLM не обладают настоящей композиционной способностью (compositional generalization). Они не умеют комбинировать разрозненные сенсорные данные, если те противоречат их «внутреннему мнению».
Интересно, что усиление временной синхронизации (temporal alignment) меняет bias ответов, но не улучшает способность разрешать конфликты. Это указывает на то, что проблема кроется не в архитектуре обработки сигналов, а в механизмах принятия решений на уровне языкового ядра.
- Дата публикации: 27 августа 2026 года.
- Веню: Принято к 2-му Workshop on Compositional Learning at ICML 2026.
- Код: Доступен для воспроизведения аудита (ссылка в оригинале).
Источник: arXiv cs.CL ↗
