Суть проблемы: 70% вычислений — это шум
Исследователь Чандрам Дутта проанализировал поведение reasoning-моделей (Qwen3-1.7B, Qwen3-8B, Magistral-Small-24B) на задачах GSM8K и MATH-500. Выяснилось, что модели склонны к «overthinking» — они продолжают генерировать цепочку мыслей (CoT) даже после того, как решение уже найдено.
Ключевая метрика: в медианном случае правильный ответ становится детерминированным уже на 30% длины цепочки рассуждений. Оставшиеся 70% — это избыточные вычисления, которые не меняют результат, но требуют ресурсов.
Механизм: Терминальная цепь (Termination Circuit)
Автор идентифицировал специфический набор слоев нейросети, отвечающий за решение прекратить генерацию. Это не глобальный механизм контроля, а локальная «проверочная дверь» (verification gate).
- Локализация: Ключевую роль играют слои MLP (Multi-Layer Perceptron) в конце сети. В модели Qwen3-1.7B слой 27 из 28 отвечает за ~40% логита решения о стопе.
- Принцип работы: Цепь не проверяет, достаточно ли рассуждений. Она проверяет факт: «Модель только что написала ответ, и он совпадает с внутренним вычислением».
- Результат: Если вставить правильный ответ в середину CoT, цепь срабатывает в 94% случаев. Если вставить тот же текст, но с неверной цифрой — только в 8%.
Почему традиционный steering не работает?
Попытки управлять остановкой через направление в residual stream (steering vectors) оказались неэффективными. Лучший найденный вектор восстановил лишь 20% эффекта от полного вмешательства в состояние.
Причина в том, что сигнал остановки — это не скаляр, накапливающийся постепенно, а высокоразмерный паттерн. Он не срабатывает, пока модель не сформулирует ответ текстом. Именно поэтому «заплатка» (patching) состояния с финального шага на ранний позволяет остановить модель в 99% случаев, а простое направление — нет.
Сравнение эффективности методов остановки
| Метод вмешательства | Эффективность срабатывания цепи | Примечание |
|---|---|---|
| Вставка правильного ответа в CoT | 94% | Совпадение текста и значения |
| Вставка ответа с неверной цифрой | 8% | Текст есть, значение не совпадает |
| Steering (векторное управление) | ~20% | Недостаточно для надежного срабатывания |
| Patching (перенос состояния) | 99% | Прямое копирование триггера |
Вывод для индустрии
Проблема не в том, что модель не может остановиться, а в том, что она не знает, когда ей стоит озвучить ответ. Терминальная цепь — это детектор совпадений, а не детектор достаточности. Чтобы сократить время инференса, разработчикам нужно учить модели формулировать кандидат-ответ раньше, а не пытаться насильно «выключить» их мышление через сложные векторы управления.
Источник: LessWrong ↗
