Суть проблемы: 90% точности — это иллюзия
Компактные модели мира (Compact World Models), способные предсказывать динамику среды на основе языковых инструкций, часто демонстрируют пугающе высокие метрики. Авторы исследования (Yufeng Wang, Lu Wei, Haibin Ling) обнаружили, что модель может достигать 90% точности при чтении пространственных отношений (например, «положи красный блок слева от синего»). Однако эта точность является результатом «утечки инструкции» (instruction leakage), а не реального восприятия.
Модель не «видит» объекты, а просто транскрибирует ответ из текста инструкции. Если убрать языковую цель из входных данных, точность падает до уровня случайного угадывания — 27% (в среднем по трем запускам). При замене инструкции на ложную, модель предсказывает anchors (якоря) согласно ложной инструкции в 94.5% случаев, игнорируя реальную сцену (лишь 2.3% совпадений с истиной). Тестирование проводилось на выборке из 256 примеров.
Диагностика и сравнение сред
Утечка происходит, когда оцениваемая величина прямо названа в инструкции. Исследователи протестировали три среды, чтобы показать, что проблема системна, но решаемая:
| Среда / Настройка | Наличие утечки | Ключевая особенность |
|---|---|---|
| Tabletop (стол) | Да | Инструкция называет целевое состояние напрямую |
| BabyAI (внешний бенчмарк) | Да | Стандартная постановка задачи с явными целями |
| Language-Table (forward-dynamics) | Нет (изначально) | Инструкция называет только референты (объекты), а не направление. Утечка возникает только при добавлении указания направления. |
Почему это важно для индустрии
Стандартная гипотеза «конкуренции предикторов» предполагает, что ухудшение качества действий должно увеличивать зависимость от инструкции. Авторы опровергают это: деградация действий не увеличивает утечку, что указывает на более глубокую архитектурную проблему. Модель использует инструкцию как «костыль» для обхода сложной задачи визуального восприятия.
Решение: Goal-Free Dynamics Fix
Авторы предлагают конкретный архитектурный фикс:
- Исключить цель (goal) из динамики: Языковая цель должна принадлежать только планировщику (cost function), а не модулю предсказания динамики мира.
- Супервизия пути чтения (read path): Обучать модель считывать состояние независимо от инструкции.
Этот подход позволил восстановить истинное, независимое от инструкции понимание пространства. Точность на истинных данных составила 0.88 (88%), причем результат оставался идентичным как при наличии, так и при отсутствии языковой цели в момент предсказания. Этот протокол обнаружения и исправления применим к любым goal-conditioned моделям, где инструкция содержит ответ.
Источник: arXiv cs.AI ↗
