Проблема простоя в парадигме ReAct
Классический подход ReAct (Reasoning + Acting) заставляет большие языковые модели действовать последовательно: сначала генерируется мысль (Thought), затем действие (Action), и только после получения ответа от среды (Observation) начинается следующий шаг. В этот период ожидания — так называемое «окно простоя» (reasoning idle window) — вычислительные ресурсы модели простаивают, а способность к глубокому анализу будущего контекста блокируется.
Решение: Second Thought
Авторы статьи (arXiv:2608.13667) предлагают фреймворк Second Thought, который не требует дообучения модели (training-free). Суть метода заключается в том, что в момент завершения фазы Thought система мгновенно форкает (копирует) четыре вспомогательные ветки (auxiliary branches). Эти ветки работают параллельно с основным процессом ожидания действия, анализируя возможные сценарии и подготавливая «вторые мысли» для будущих шагов.
Ключевые характеристики метода
- Отсутствие дообучения: Метод работает на уровне инференса (вывода), что делает его совместимым с любыми существующими LLM-агентами.
- Параллелизм: Использование 4-х параллельных веток позволяет модели «заглянуть в будущее» во время ожидания ответа от внешнего мира.
- Эффективность: Устранение простоя в фазе Observation повышает общую пропускную способность агента.
Значение для индустрии
Предложенный подход решает фундаментальную проблему последовательных агентов — низкую утилизацию вычислительных ресурсов. Переход от строгой последовательности к гибридной модели с параллельным предварительным анализом может существенно ускорить выполнение сложных многошаговых задач, таких как автономное программирование или исследование данных, где время ожидания ответа от инструментов (API, браузер) является основным узким местом.
Источник: arXiv cs.AI ↗
