Исследования11 июля 2026 г., 05:16 МСК🤖 Auto

Терминальная цепь: почему модели рассуждения «думают» слишком долго

Исследование выявило механизм, заставляющий LLM тратить до 70% вычислений на лишние рассуждения. Оказывается, модель знает ответ задолго до финала, но «цепь остановки» срабатывает только при совпадении сформулированного и вычисленного.

Баннер новости 3353

Суть проблемы: 70% вычислений — это шум

Исследователь Чандрам Дутта проанализировал поведение reasoning-моделей (Qwen3-1.7B, Qwen3-8B, Magistral-Small-24B) на задачах GSM8K и MATH-500. Выяснилось, что модели склонны к «overthinking» — они продолжают генерировать цепочку мыслей (CoT) даже после того, как решение уже найдено.

Ключевая метрика: в медианном случае правильный ответ становится детерминированным уже на 30% длины цепочки рассуждений. Оставшиеся 70% — это избыточные вычисления, которые не меняют результат, но требуют ресурсов.

Механизм: Терминальная цепь (Termination Circuit)

Автор идентифицировал специфический набор слоев нейросети, отвечающий за решение прекратить генерацию. Это не глобальный механизм контроля, а локальная «проверочная дверь» (verification gate).

  • Локализация: Ключевую роль играют слои MLP (Multi-Layer Perceptron) в конце сети. В модели Qwen3-1.7B слой 27 из 28 отвечает за ~40% логита решения о стопе.
  • Принцип работы: Цепь не проверяет, достаточно ли рассуждений. Она проверяет факт: «Модель только что написала ответ, и он совпадает с внутренним вычислением».
  • Результат: Если вставить правильный ответ в середину CoT, цепь срабатывает в 94% случаев. Если вставить тот же текст, но с неверной цифрой — только в 8%.

Почему традиционный steering не работает?

Попытки управлять остановкой через направление в residual stream (steering vectors) оказались неэффективными. Лучший найденный вектор восстановил лишь 20% эффекта от полного вмешательства в состояние.

Причина в том, что сигнал остановки — это не скаляр, накапливающийся постепенно, а высокоразмерный паттерн. Он не срабатывает, пока модель не сформулирует ответ текстом. Именно поэтому «заплатка» (patching) состояния с финального шага на ранний позволяет остановить модель в 99% случаев, а простое направление — нет.

Сравнение эффективности методов остановки

Метод вмешательства Эффективность срабатывания цепи Примечание
Вставка правильного ответа в CoT 94% Совпадение текста и значения
Вставка ответа с неверной цифрой 8% Текст есть, значение не совпадает
Steering (векторное управление) ~20% Недостаточно для надежного срабатывания
Patching (перенос состояния) 99% Прямое копирование триггера

Вывод для индустрии

Проблема не в том, что модель не может остановиться, а в том, что она не знает, когда ей стоит озвучить ответ. Терминальная цепь — это детектор совпадений, а не детектор достаточности. Чтобы сократить время инференса, разработчикам нужно учить модели формулировать кандидат-ответ раньше, а не пытаться насильно «выключить» их мышление через сложные векторы управления.

Источник: LessWrong ↗