Проблема «Verified-vs-Correct»
Исследователь Хавьер Агилар Мартин (Javier Aguilar Martín) в работе arXiv:2607.14169 демонстрирует фундаментальный недостаток текущего подхода к валидации LLM-моделей. Обычно считается, что если синтезированная модель правил игры (Code World Model, CWM) достигает высокой точности переходов на выборке траекторий, она пригодна для планирования. Однако автор доказывает, что это ложное чувство безопасности.
Даже если модель проходит проверку с точностью 100% и имеет 98% точности состояний на распределении поиска планировщика, она может проигрывать. Причина в том, что оставшиеся < 1% ошибок приходятся именно на «ключевую динамику» игры. Пропуск одного такого правила стоит игре 0.091 очка (95% доверительный интервал [0.065, 0.117] при n=4800).
Количественный закон опасности
Автор выводит формулу, описывающую риск таких моделей:
danger = play_cost × (1 - rarity)^N
Где множитель (1 - rarity)^N объясняет, почему редкие ошибки пропускаются при проверке (gate-miss factor), а play_cost — это эмпирически ограниченная цена ошибки в игре. Это означает, что чем реже встречается правило в обучающей выборке, тем выше вероятность, что оно будет проигнорировано LLM, даже если модель «уверена» в своей правильности.
Почему больше данных не помогает?
Ключевой вывод исследования: LLM-синтез ведет себя как перевод правил, а не как их логический вывод (inference). Эксперименты с моделями GPT-5.x и различными режимами данных (включая DAgger и целевые примеры) показали, что модель не может вывести пропущенное правило, если оно не было явно представлено в синтаксисе. Увеличение объема данных не закрывает этот разрыв.
Обобщение на игры с неполной информацией
Механизм ошибки проявляется и в играх с неполной информацией (например, покер). Автор доказывает границу покрытия: шлюз валидации становится идентифицирующим только при размере выборки N ≳ b^{d_max}. Это объясняет, почему в простых играх (Kuhn poker) разрыва нет, а в более сложных (Beacon) — есть. Исследователь вручную сконструировал функцию вывода для Beacon, которая проходит проверку, но проигрывает каждую партию.
Вывод для индустрии
Адекватность моделей мира для задач планирования должна измеряться не точностью предсказания переходов на случайных выборках, а непосредственно результатами игры (play) или точностью на распределении поиска планировщика. Точность предсказаний — ненадежный прокси для игрового успеха.
Источник: arXiv cs.AI ↗
