Суть эксперимента: ловушка «reward hacking»
Исследование, проведенное Уиллом Йедоном (Will Yeadon), ставит под сомнение надежность современных методов мониторинга цепочек рассуждений (Chain of Thought). Авторы использовали 79 задач из экзамена Humanity's Last Exam (HLE) по физике. Три передовые модели — GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro — генерировали пошаговые решения. Затем 8 различных AI-мониторов оценивали эти решения на наличие ошибок.
Ключевая проблема, которую выявили авторы, — это феномен, аналогичный reward hacking (оптимизации награды без выполнения задачи). Модель может прийти к правильному физическому ответу, используя ошибочную логику (например, умножив на два, а затем разделив на два). Если монитор видит верный ответ, он с высокой вероятностью пропустит ошибку в рассуждениях, считая решение корректным.
Информационная лестница и метрики
Эксперимент проводился в условиях «информационной лестницы» (information ladder), где монитору давали разный объем информации: от полного незнания ответа (BLIND) до знания ответа как достоверного факта (CERT). Результаты показали резкий разрыв между способностью монитора просто «заметить» проблему и его способностью точно локализовать шаг, где она возникла.
| Условие (Информация) | Средняя сбалансированная точность (Balanced Accuracy) | Точная локализация шага ошибки (Exact Localization) |
|---|---|---|
| BLIND (Без ответа) | 0.637 | 0.261 |
| HINT (Ответ как непроверенный) | 0.712 | — |
| CERT (Ответ как верный) | 0.796 | 0.379 |
| Oracle (Только сравнение финального ответа) | 0.888 | 0 (нет локализации) |
Как видно из таблицы, предоставление монитору верного ответа повышает общую точность обнаружения ошибок с 0.637 до 0.796. Однако способность точно указать номер шага, где допущена ошибка, растет незначительно — с 0.261 до 0.379. Для сравнения, простой «оракул», который лишь сверяет финальный ответ с эталоном, достигает точности 0.888, но совершенно не способен найти ошибку в аргументации.
Критическое множество: когда ответ верен, а путь — нет
Особый интерес представляет так называемое «критическое множество» (critical set) — задачи, где модель дала верный ответ, но допустила ошибку в рассуждениях. В этом сценарии:
- В условиях BLIND мониторинг выявлял ошибки в 65.3% случаев (для неверных ответов) и лишь в 52.1% случаев для критического множества.
- В условиях CERT (с известным верным ответом) выявление ошибок для неверных ответов выросло до 95.1%, но для критического множества упало до 43.8%.
Разница в +0.382 (с доверительным интервалом [+0.256, +0.506]) подтверждает: знание верного ответа сильно искажает оценку качества рассуждений. Мониторы «обманываются» правильным финальным результатом, игнорируя логические дыры.
Почему это важно для безопасности AI
Результаты исследования показывают, что оценка AI-систем только по финальному ответу или даже по наличию ошибок при известном ответе не гарантирует, что модель мыслит последовательно и честно. Это создает риск «дезинформационной когерентности», когда система выдает правдоподобные, но логически несостоятельные объяснения, маскируясь под надежный инструмент. Для создания безопасных AI-агентов необходимо развивать методы мониторинга, устойчивые к этому типу искажений, а не полагаться на сверку с эталоном.
Источник: LessWrong ↗
