Исследования3 июля 2026 г., 13:16 МСК🤖 Auto

Хрупкая правильность: почему рассуждения снижают точность LLM

Исследование выявило феномен, когда модели теряют верный ответ в процессе цепочки рассуждений (CoT). Увеличение времени инференса не всегда помогает, а иногда вредит.

Баннер новости 2840

Парадокс «хрупкой правильности»

Новое исследование, опубликованное на LessWrong, вскрывает контринтуитивную проблему в работе современных LLM: модель может уверенно генерировать правильный ответ, но последующие шаги рассуждения «сбивают» её с верного пути. Автор статьи, Tobypullan, вводит термин fragile correctness (хрупкая правильность) — состояние, при котором распределение вероятностей модели благоприятствует верному ответу, но продолжение генерации увеличивает риск ошибки.

Этот феномен подтверждается системными картами крупных моделей. Например, в документации Opus 4.8 зафиксировано, что использование максимального количества токенов на размышление (max thinking) дает меньший процент прохождения тестов SWE-Bench Pro, чем режим x-high thinking. Аналогичные аномалии наблюдаются в моделях Fable и Mythos.

Методология и ключевые цифры

Для анализа исследователи использовали модель Gemma 4-12b-it и методику проксирования траектории рассуждений (reasoning trajectory probe), разбивая цепочку мыслей на децили. Тестирование проводилось на 1198 вопросах из наборов данных MMLU-pro и GPQA-diamond.

Введены два ключевых показателя:

  • Answer loss: модель в какой-то момент дала верный ответ, но в финале ошиблась.
  • Normalised loss: модель была уверена в правильном ответе (вероятность >0.9), но в итоге выбрала неверный вариант.

Результаты: статистика потерь

Результаты показывают, что проблема массова и не сводится к случайному угадыванию. Повторные запуски с разными seed-ами подтвердили воспроизводимость ошибки в 46.8% случаев для категории answer loss.

Набор данных Всего вопросов Answer loss (кол-во / %) Normalised loss (кол-во / %)
MMLU-Pro 1000 122 (12.2%) 37 (3.7%)
GPQA Diamond 198 57 (28.8%) 15 (7.6%)
Итого 1198 179 (14.9%) 52 (4.3%)

Решение: ранняя остановка через линейные зонды

Авторы разработали линейные классификаторы (probes) для обнаружения состояния «хрупкой правильности» на скрытых слоях модели. Обучение проводилось на 13 500 примерах, выделяя слои с шагом в 4. Наиболее эффективным оказался зонд future_loss, который предсказывает, что текущий ответ верен, но финальный будет ошибочным.

Внедрение механизма ранней остановки (halting intervention) на основе этого зонда позволило:

  • Повысить точность на вопросах с answer loss на 5.2%.
  • Повысить точность на вопросах с normalised loss на 8.3%.

Это доказывает, что остановка генерации в момент пиковой уверенности в правильном ответе эффективнее, чем принудительное дописывание рассуждений, что открывает путь к оптимизации затрат на инференс без потери качества.

Источник: LessWrong ↗