Проблема устаревания контекста
Развитие decision-pretrained трансформеров и retrieval-augmented агентов возродило интерес к In-Context Reinforcement Learning (ICRL). Ключевая особенность ICRL — способность модели улучшать поведение на основе взаимодействия с окружением без обновления параметров во время тестирования. Однако существующие обзоры фокусируются на архитектурах и целях предобучения, игнорируя критический аспект: нестационарность среды.
В меняющихся условиях накопленный контекст перестает быть просто «дополнительными доказательствами». Параметры вознаграждения, ядра переходов, каналы наблюдений или даже интерфейс действий могут измениться. Старый контекст становится не просто бесполезным, а вводящим в заблуждение, так как он описывает уже несуществующие правила игры.
Три ключевых вопроса нестационарного ICRL
Авторы предлагают новую классификацию литературы, основанную на трех вопросах, которые должен решать агент с фиксированными весами:
- Что меняется? — Определение типа сдвига (reward specification, transition kernel, observation channel).
- Как разворачивается изменение? — Плавный дрейф или резкие скачки в распределении данных.
- Насколько изменение наблюдаемо? — Может ли агент напрямую видеть сдвиг или должен выводить его из скрытых состояний.
Связь с другими парадигмами
Нестационарный ICRL рассматривается не изолированно, а в связке с мета-обучением (meta-RL), моделированием последовательностей решений и агентами с обратной связью по вознаграждению. Главная задача — научить политику инферировать текущее правило принятия решений и одновременно определять, какие части накопленного опыта (context window) все еще релевантны, а какие следует игнорировать.
| Аспект | Стандартный ICRL | Нестационарный ICRL (New Focus) |
|---|---|---|
| Цель контекста | Извлечение правил фиксированной задачи | Адаптация к меняющимся правилам |
| Роль прошлого опыта | Полезные доказательства для вывода | Риск «зашумления» или введения в заблуждение |
| Обновление модели | Отсутствует (zero-shot/few-shot) | Отсутствует, но требуется фильтрация контекста |
| Ключевая сложность | Объем и формат данных | Временная несовместимость данных (staleness) |
Почему это важно
Исследование закладывает теоретический фундамент для создания робастных автономных агентов, способных работать в реальных условиях, где среда никогда не бывает статичной. Понимание механизмов отбрасывания устаревшего контекста критично для применения ICRL в робототехнике, трейдинге и управлении ресурсами.
Источник: arXiv cs.AI ↗
