Парадокс «хрупкой правильности»
Новое исследование, опубликованное на LessWrong, вскрывает контринтуитивную проблему в работе современных LLM: модель может уверенно генерировать правильный ответ, но последующие шаги рассуждения «сбивают» её с верного пути. Автор статьи, Tobypullan, вводит термин fragile correctness (хрупкая правильность) — состояние, при котором распределение вероятностей модели благоприятствует верному ответу, но продолжение генерации увеличивает риск ошибки.
Этот феномен подтверждается системными картами крупных моделей. Например, в документации Opus 4.8 зафиксировано, что использование максимального количества токенов на размышление (max thinking) дает меньший процент прохождения тестов SWE-Bench Pro, чем режим x-high thinking. Аналогичные аномалии наблюдаются в моделях Fable и Mythos.
Методология и ключевые цифры
Для анализа исследователи использовали модель Gemma 4-12b-it и методику проксирования траектории рассуждений (reasoning trajectory probe), разбивая цепочку мыслей на децили. Тестирование проводилось на 1198 вопросах из наборов данных MMLU-pro и GPQA-diamond.
Введены два ключевых показателя:
- Answer loss: модель в какой-то момент дала верный ответ, но в финале ошиблась.
- Normalised loss: модель была уверена в правильном ответе (вероятность >0.9), но в итоге выбрала неверный вариант.
Результаты: статистика потерь
Результаты показывают, что проблема массова и не сводится к случайному угадыванию. Повторные запуски с разными seed-ами подтвердили воспроизводимость ошибки в 46.8% случаев для категории answer loss.
| Набор данных | Всего вопросов | Answer loss (кол-во / %) | Normalised loss (кол-во / %) |
|---|---|---|---|
| MMLU-Pro | 1000 | 122 (12.2%) | 37 (3.7%) |
| GPQA Diamond | 198 | 57 (28.8%) | 15 (7.6%) |
| Итого | 1198 | 179 (14.9%) | 52 (4.3%) |
Решение: ранняя остановка через линейные зонды
Авторы разработали линейные классификаторы (probes) для обнаружения состояния «хрупкой правильности» на скрытых слоях модели. Обучение проводилось на 13 500 примерах, выделяя слои с шагом в 4. Наиболее эффективным оказался зонд future_loss, который предсказывает, что текущий ответ верен, но финальный будет ошибочным.
Внедрение механизма ранней остановки (halting intervention) на основе этого зонда позволило:
- Повысить точность на вопросах с answer loss на 5.2%.
- Повысить точность на вопросах с normalised loss на 8.3%.
Это доказывает, что остановка генерации в момент пиковой уверенности в правильном ответе эффективнее, чем принудительное дописывание рассуждений, что открывает путь к оптимизации затрат на инференс без потери качества.
Источник: LessWrong ↗
