Исследования16 июля 2026 г., 08:16 МСК🤖 Auto

LLM решают, но не думают: новый тест выявил «пустую» логику GPT-4o

Исследователь Hironao Nakamura представил метод Interventional Grounding Audits, который доказывает, что GPT-4o часто выдает верные ответы, используя ложные логические цепочки. Метод превосходит стандартные проверки согласованности.

Баннер новости 3695

Проблема «правильного ответа, неправильного рассуждения»

Большие языковые модели (LLM) часто демонстрируют цепочки рассуждений (Chain-of-Thought, CoT), которые выглядят логически связными, но на деле не зависят от заявленных посылок. Исследователь Хиронао Накамура представил метод Interventional Grounding Audits — черный ящик для проверки зависимости шагов рассуждения от исходных данных. Суть метода проста: исследователи заменяют ключевой предикат в одной из посылок на новый символ, запускают модель заново и смотрят, изменился ли вывод каждого шага. Если вывод не меняется, значит, модель «игнорирует» эту посылку, даже если формально ответ верен.

Результаты на бенчмарке ProntoQA

Метод был протестирован на синтетическом наборе данных ProntoQA, который содержит многошаговые дедуктивные задачи с известными «золотыми» деревьями доказательств. Тестирование проводилось на модели GPT-4o на выборке из 50 задач. Результаты показали высокую эффективность нового подхода по сравнению с базовым методом самосогласованности (self-consistency).

Метод F1 Score Recall Примечание
Interventional Grounding Audits 0.806 100% Выявление зависимостей в дереве доказательств
Interventional Grounding Audits (предикаты) 0.885 Выявление зависимостей от конкретных предикатов
Self-Consistency Baseline 0.343 Стандартный метод проверки согласованности

Доверительные интервалы (95% bootstrap CIs) для методов не пересекаются, что статистически подтверждает превосходство предложенного аудита.

Скрытые уязвимости модели

Самое тревожное открытие заключается в том, что 66% задач, которые GPT-4o решила правильно, содержали хотя бы один шаг рассуждения, нечувствительный к изменению посылок. Эти ошибки были связаны с введением новых сущностей (entity-introduction premises) — известным «слепым пятном» для традиционных методов оценки. Пассивные методы проверки не способны обнаружить ситуацию, когда модель приходит к верному выводу, используя совершенно другую, не заявленную логику.

Значение для индустрии

Работа принята на ICLR 2026 Workshop on Logical Reasoning of Large Language Models. Все сертификаты аудита, сырые данные и скрипты для воспроизведения доступны в открытом репозитории GitHub. Это важный шаг к переходу от оценки «что ответила модель» к оценке «как она пришла к ответу», что критически важно для применения LLM в сферах, требующих строгой логической достоверности.

Источник: arXiv cs.AI ↗