Проблема стандартного HRL
Плоские агенты обучения с подкреплением (RL) часто терпят неудачу в средах с разреженными наградами, требующих долгосрочного планирования. Стандартная иерархическая RL (HRL) пытается решить это, но использует фиксированную структуру знаний, которая не обновляется в процессе обучения. Это приводит к низкой эффективности использования сэмплов (sample efficiency), так как агент не может использовать накопленный опыт для улучшения логики принятия решений.
Решение: Нейросимволический подход с инкрементальными знаниями
Авторы (Subrat Prasad Panda, Blaise Genest, Arvind Easwaran) предлагают архитектуру InK-HRL (Incremental Knowledge Hierarchical Reinforcement Learning). Система разделяет задачи на два уровня:
- Высокий уровень (Символический): Использует обновляемое представление знаний (InK) и алгоритмы символического планирования (например, D*) для построения стратегии.
- Низкий уровень (Нейросетевой): Условные нейронные модули обучаются на основе опыта, формируя примитивы движения с помощью формирования награды (reward shaping).
Ключевые метрики и результаты
Эксперименты проводились на задачах навигации. Внедрение инкрементальных знаний позволило существенно сократить количество шагов, необходимых для достижения цели по сравнению с базовыми методами. Для оптимизации планирования при наличии априорных знаний разработана структура Belief World Tree Search.
| Компонент | Роль в InK-HRL | Технология/Алгоритм |
|---|---|---|
| Планирование | Высокоуровневая стратегия | Символический планинг (D*) |
| Движение | Низкоуровневое управление | Условные нейронные модули |
| Знания | Хранение и обновление | Инкрементальные знания (InK) |
| Оптимизация | Поиск в пространстве состояний | Belief World Tree Search |
Значение для индустрии
Работа опубликована на конференции ECML-PKDD 2026. Код алгоритма доступен для воспроизведения. Подход открывает путь к созданию более автономных роботов и ИИ-агентов, способных быстро адаптироваться к новым условиям без необходимости переобучения с нуля.
Источник: arXiv cs.AI ↗
