Исследования3 августа 2026 г., 08:17 МСК🤖 Auto

ThinkReset: Как LLM решают длинные задачи, сбрасывая контекст

Исследователи представили ThinkReset — метод, позволяющий LLM эффективно работать с длинными цепочками рассуждений (CoT) за счет создания переиспользуемых промежуточных интерфейсов и сброса контекста.

Баннер новости 4927

Проблема длинных цепочек рассуждений

Долгие цепочки рассуждений (Chain-of-Thought, CoT) значительно повышают точность моделей при решении сложных задач, но сталкиваются с тремя критическими проблемами: накоплением избыточности, переполнением контекстного окна и «заякориванием» ошибок. Авторы статьи подчеркивают, что в условиях ограниченного контекстного окна главная проблема не в сжатии траектории или контроле во время тестирования, а в отсутствии переиспользуемого промежуточного интерфейса, который мог бы заменить отброшенную историю и поддержать дальнейшее решение.

Механизм ThinkReset

Предложенный метод ThinkReset реализует эту идею в текстовом пространстве. Ключевые особенности подхода:

  • Интерфейсный возврат (Interface Writeback): Модель явно конструирует переиспользуемые промежуточные интерфейсы.
  • Сброс (Reset): После создания интерфейса происходит сброс контекста, что позволяет избежать переполнения окна.
  • Оптимизация продолжения: Прямая оптимизация успеха продолжения решения после сброса.

Проблема награды за результат

Авторы выделяют ключевой режим отказа при долгосрочном обучении с подкреплением, основанном на награде за результат (outcome-reward-driven): если модель не решает задачу до того, как окно контекста почти исчерпано, награда за финальный ответ стимулирует преждевременные догадки, а не тщательное продолжение рассуждений. ThinkReset решает эту проблему, позволяя модели «перезагрузить» контекст, сохранив суть пройденных шагов.

Результаты и значимость

Эксперименты показывают, что этот подход последовательно повышает показатели успешности (success rates) на нескольких бенчмарках долгосрочного рассуждения при фиксированных контекстных окнах. Это открывает путь к более эффективному использованию ограниченных ресурсов вычислений при работе с длинными задачами.

Аспект Стандартный подход (CoT) ThinkReset
Управление контекстом Накопление всей истории Сброс с сохранением интерфейса
Основная проблема Переполнение окна, избыточность Отсутствие переиспользуемого интерфейса
Оптимизация Награда за финальный ответ Успех продолжения после сброса
Риск Преждевременные догадки Снижен за счет структурированного сброса

Источник: arXiv cs.AI ↗