Исследования1 июля 2026 г., 12:18 МСК🤖 Auto

LearnStop: Когда ранний выход из LLM-рассуждений экономит деньги, а когда нет

Исследование Stanford и University of Maine показывает, что сложные модели раннего выхода (LearnStop) выгодны только для свободных математических задач, тогда как простые метрики уверенности лучше для тестов с выбором ответа.

Баннер новости 2724

Проблема вычислительных затрат в Reasoning Models

Модели, способные к цепочечным рассуждениям (Chain-of-Thought), потребляют разное количество вычислительных ресурсов для разных задач. Однако вопрос о том, когда обучаемые правила остановки превосходят простые пороговые значения (confidence/convergence), оставался открытым. Авторы представляют LearnStop — механизм раннего выхода, не требующий доступа к скрытым состояниям (hidden-state-free), который работает на фиксированных контрольных точках бюджета вычислений.

Методология и архитектура LearnStop

LearnStop анализирует короткую версию ответа на текущем префиксе рассуждений. Модель предсказывает корректность, опираясь на онлайн-фичи, такие как:

  • Уверенность ответа (answer confidence);
  • Энтропия;
  • Доля голосов префикса (prefix vote share);
  • Стабильность ответа;
  • Плотность маркеров возврата (backtracking-marker density).

Ключевые результаты: Эмпирическая граница

Исследование охватило 18 настроек задач и моделей, включая Qwen3-32B и дистилляции DeepSeek-R1. Тестирование проводилось на наборах данных GSM8K, MATH-500, MMLU-Pro, AIME-90 и GPQA. Результаты показали сильную зависимость эффективности от типа задачи:

Тип задачи Лучший метод остановки Ключевая метрика (GSM8K + Qwen3-32B)
Свободная математика (Free-form math) LearnStop (обучаемый) Прирост адаптивности +0.157; парный прирост над скалярным базисом +0.028
Выбор ответа / Сверхсложные задачи Скалярные правила (уверенность/энтропия) Скалярные выходы конкурентоспособны или сильнее

Экономический эффект и профилирование

Авторы провели детальный учет затрат в режимах KV-fork, prefix-cache и black-box, используя профилирование на GPU NVIDIA H100. Главный вывод: обучаемая остановка полезна, когда многие вопросы становятся правильными до исчерпания полного бюджета, но при этом отсутствует единый надежный скалярный сигнал. Если же уверенность или сходимость ответа уже решают проблему остановки, преимущества LearnStop исчезают.

Вывод для индустрии

LearnStop не является универсальной заменой простых эвристик. Его внедрение оправдано в сценариях с высокой вариативностью сложности задач (например, свободное решение математических проблем), где он позволяет экономить вычислительные ресурсы, не теряя в качестве ответа. Для стандартизированных тестов с выбором ответа остаются эффективнее простые пороги уверенности.

Источник: arXiv cs.AI ↗