Проблема вычислительных затрат в Reasoning Models
Модели, способные к цепочечным рассуждениям (Chain-of-Thought), потребляют разное количество вычислительных ресурсов для разных задач. Однако вопрос о том, когда обучаемые правила остановки превосходят простые пороговые значения (confidence/convergence), оставался открытым. Авторы представляют LearnStop — механизм раннего выхода, не требующий доступа к скрытым состояниям (hidden-state-free), который работает на фиксированных контрольных точках бюджета вычислений.
Методология и архитектура LearnStop
LearnStop анализирует короткую версию ответа на текущем префиксе рассуждений. Модель предсказывает корректность, опираясь на онлайн-фичи, такие как:
- Уверенность ответа (answer confidence);
- Энтропия;
- Доля голосов префикса (prefix vote share);
- Стабильность ответа;
- Плотность маркеров возврата (backtracking-marker density).
Ключевые результаты: Эмпирическая граница
Исследование охватило 18 настроек задач и моделей, включая Qwen3-32B и дистилляции DeepSeek-R1. Тестирование проводилось на наборах данных GSM8K, MATH-500, MMLU-Pro, AIME-90 и GPQA. Результаты показали сильную зависимость эффективности от типа задачи:
| Тип задачи | Лучший метод остановки | Ключевая метрика (GSM8K + Qwen3-32B) |
|---|---|---|
| Свободная математика (Free-form math) | LearnStop (обучаемый) | Прирост адаптивности +0.157; парный прирост над скалярным базисом +0.028 |
| Выбор ответа / Сверхсложные задачи | Скалярные правила (уверенность/энтропия) | Скалярные выходы конкурентоспособны или сильнее |
Экономический эффект и профилирование
Авторы провели детальный учет затрат в режимах KV-fork, prefix-cache и black-box, используя профилирование на GPU NVIDIA H100. Главный вывод: обучаемая остановка полезна, когда многие вопросы становятся правильными до исчерпания полного бюджета, но при этом отсутствует единый надежный скалярный сигнал. Если же уверенность или сходимость ответа уже решают проблему остановки, преимущества LearnStop исчезают.
Вывод для индустрии
LearnStop не является универсальной заменой простых эвристик. Его внедрение оправдано в сценариях с высокой вариативностью сложности задач (например, свободное решение математических проблем), где он позволяет экономить вычислительные ресурсы, не теряя в качестве ответа. Для стандартизированных тестов с выбором ответа остаются эффективнее простые пороги уверенности.
Источник: arXiv cs.AI ↗
