Исследования9 июля 2026 г., 07:18 МСК🤖 Auto

Теория In-Context Search: когда рефлексия дает экспоненциальный прирост

Исследователи из Hebrew University of Jerusalem доказали, что In-Context Search (ICS) дает экспоненциальное улучшение только при условии точной локализации ошибок. Иначе это параллельный семплинг.

Баннер новости 3175

Суть открытия: In-Context Search — это не магия, а байесовское обновление

Команда исследователей во главе с Yotam Wolf, Noam Wies и Amnon Shashua опубликовала работу, предлагающую строгую теоретическую базу для In-Context Search (ICS). В отличие от эмпирических подходов, авторы моделируют процесс рассуждения как приближенное байесовское выведение (approximate inference). Базовая модель задает априорное распределение, а саморефлексия (reflection) выступает в роли обратной связи для обновления апостериорного распределения.

Ключевой метрикой здесь становится инференс-тайм сложность семплирования — количество последовательных попыток, необходимых для достижения высокой вероятности успеха. Исследование показывает, что ICS работает не всегда, а только при выполнении специфического условия.

Когда рефлексия работает, а когда — нет

Авторы вывели четкое математическое условие, при котором In-Context Search дает экспоненциальное улучшение по сравнению с базовой моделью. Если механизм рефлексии способен надежно локализовать ранние ошибки в рассуждении, модель может решить задачи с экспоненциально малой вероятностью успеха (zero-shot pass rate) всего за полиномиальное число последовательных попыток.

Однако, если рефлексия не справляется с локализацией ошибок, условное распределение на основе прошлых попыток не дает асимптотического преимущества. В таком случае ICS вырождается в простой параллельный семплинг, где каждая попытка независима, и экономии вычислительных ресурсов не происходит.

Сравнение подходов: Экспоненциальный рост vs Параллельный семплинг

Характеристика In-Context Search (при успешной локализации ошибок) Параллельный семплинг (без локализации)
Сложность семплирования Полиномиальная (полином от сложности задачи) Экспоненциальная (зависит от редкости решения)
Механизм Последовательное обновление апостериорного распределения Независимые генерации без учета контекста
Роль рефлексии Критически важна для сужения пространства поиска Отсутствует или неэффективна
Результат Экспоненциальное улучшение вероятности успеха Отсутствие асимптотического преимущества

Обучаемость и связь с RLHF

Исследование также доказывает, что эти преимущества устойчивы и обучаемы. Для достижения нужного поведения достаточно аппроксимировать апостериорные обновления. Авторы показывают, что кросс-энтропийное обучение на rollout-ах поиска восстанавливает требуемое поведение с полиномиальной сложностью выборки.

Дополнительно, в рамках ступенчатой абстракции обучения с подкреплением (RL) с верифицируемыми наградами, оптимальными наградами, оптимальная политика реализует то же самое правило переобвешивания апостериорного распределения. Это связывает теорию In-Context Search с фундаментальными принципами оптимизации LLM.

Практическое значение

Для разработчиков и исследователей это означает, что слепое добавление циклов рефлексии в промпты не гарантирует ускорения решения сложных задач. Эффективность In-Context Search напрямую зависит от способности модели точно указывать, где именно она ошиблась. Без этого свойства вычислительные затраты растут экспоненциально, нивелируя преимущества последовательного поиска.

Источник: arXiv cs.AI ↗