Проблема «правильного ответа, неправильного рассуждения»
Большие языковые модели (LLM) часто демонстрируют цепочки рассуждений (Chain-of-Thought, CoT), которые выглядят логически связными, но на деле не зависят от заявленных посылок. Исследователь Хиронао Накамура представил метод Interventional Grounding Audits — черный ящик для проверки зависимости шагов рассуждения от исходных данных. Суть метода проста: исследователи заменяют ключевой предикат в одной из посылок на новый символ, запускают модель заново и смотрят, изменился ли вывод каждого шага. Если вывод не меняется, значит, модель «игнорирует» эту посылку, даже если формально ответ верен.
Результаты на бенчмарке ProntoQA
Метод был протестирован на синтетическом наборе данных ProntoQA, который содержит многошаговые дедуктивные задачи с известными «золотыми» деревьями доказательств. Тестирование проводилось на модели GPT-4o на выборке из 50 задач. Результаты показали высокую эффективность нового подхода по сравнению с базовым методом самосогласованности (self-consistency).
| Метод | F1 Score | Recall | Примечание |
|---|---|---|---|
| Interventional Grounding Audits | 0.806 | 100% | Выявление зависимостей в дереве доказательств |
| Interventional Grounding Audits (предикаты) | 0.885 | — | Выявление зависимостей от конкретных предикатов |
| Self-Consistency Baseline | 0.343 | — | Стандартный метод проверки согласованности |
Доверительные интервалы (95% bootstrap CIs) для методов не пересекаются, что статистически подтверждает превосходство предложенного аудита.
Скрытые уязвимости модели
Самое тревожное открытие заключается в том, что 66% задач, которые GPT-4o решила правильно, содержали хотя бы один шаг рассуждения, нечувствительный к изменению посылок. Эти ошибки были связаны с введением новых сущностей (entity-introduction premises) — известным «слепым пятном» для традиционных методов оценки. Пассивные методы проверки не способны обнаружить ситуацию, когда модель приходит к верному выводу, используя совершенно другую, не заявленную логику.
Значение для индустрии
Работа принята на ICLR 2026 Workshop on Logical Reasoning of Large Language Models. Все сертификаты аудита, сырые данные и скрипты для воспроизведения доступны в открытом репозитории GitHub. Это важный шаг к переходу от оценки «что ответила модель» к оценке «как она пришла к ответу», что критически важно для применения LLM в сферах, требующих строгой логической достоверности.
Источник: arXiv cs.AI ↗
