Суть открытия: In-Context Search — это не магия, а байесовское обновление
Команда исследователей во главе с Yotam Wolf, Noam Wies и Amnon Shashua опубликовала работу, предлагающую строгую теоретическую базу для In-Context Search (ICS). В отличие от эмпирических подходов, авторы моделируют процесс рассуждения как приближенное байесовское выведение (approximate inference). Базовая модель задает априорное распределение, а саморефлексия (reflection) выступает в роли обратной связи для обновления апостериорного распределения.
Ключевой метрикой здесь становится инференс-тайм сложность семплирования — количество последовательных попыток, необходимых для достижения высокой вероятности успеха. Исследование показывает, что ICS работает не всегда, а только при выполнении специфического условия.
Когда рефлексия работает, а когда — нет
Авторы вывели четкое математическое условие, при котором In-Context Search дает экспоненциальное улучшение по сравнению с базовой моделью. Если механизм рефлексии способен надежно локализовать ранние ошибки в рассуждении, модель может решить задачи с экспоненциально малой вероятностью успеха (zero-shot pass rate) всего за полиномиальное число последовательных попыток.
Однако, если рефлексия не справляется с локализацией ошибок, условное распределение на основе прошлых попыток не дает асимптотического преимущества. В таком случае ICS вырождается в простой параллельный семплинг, где каждая попытка независима, и экономии вычислительных ресурсов не происходит.
Сравнение подходов: Экспоненциальный рост vs Параллельный семплинг
| Характеристика | In-Context Search (при успешной локализации ошибок) | Параллельный семплинг (без локализации) |
|---|---|---|
| Сложность семплирования | Полиномиальная (полином от сложности задачи) | Экспоненциальная (зависит от редкости решения) |
| Механизм | Последовательное обновление апостериорного распределения | Независимые генерации без учета контекста |
| Роль рефлексии | Критически важна для сужения пространства поиска | Отсутствует или неэффективна |
| Результат | Экспоненциальное улучшение вероятности успеха | Отсутствие асимптотического преимущества |
Обучаемость и связь с RLHF
Исследование также доказывает, что эти преимущества устойчивы и обучаемы. Для достижения нужного поведения достаточно аппроксимировать апостериорные обновления. Авторы показывают, что кросс-энтропийное обучение на rollout-ах поиска восстанавливает требуемое поведение с полиномиальной сложностью выборки.
Дополнительно, в рамках ступенчатой абстракции обучения с подкреплением (RL) с верифицируемыми наградами, оптимальными наградами, оптимальная политика реализует то же самое правило переобвешивания апостериорного распределения. Это связывает теорию In-Context Search с фундаментальными принципами оптимизации LLM.
Практическое значение
Для разработчиков и исследователей это означает, что слепое добавление циклов рефлексии в промпты не гарантирует ускорения решения сложных задач. Эффективность In-Context Search напрямую зависит от способности модели точно указывать, где именно она ошиблась. Без этого свойства вычислительные затраты растут экспоненциально, нивелируя преимущества последовательного поиска.
Источник: arXiv cs.AI ↗
