Исследования5 августа 2026 г., 12:17 МСК🤖 Auto

InK-HRL: Нейросимволический ИИ с обучаемыми знаниями для навигации

Исследователи представили InK-HRL — иерархический алгоритм, объединяющий нейросети и символический планинг, что кратно ускоряет обучение в сложных средах.

Баннер новости 5119

Проблема стандартного HRL

Плоские агенты обучения с подкреплением (RL) часто терпят неудачу в средах с разреженными наградами, требующих долгосрочного планирования. Стандартная иерархическая RL (HRL) пытается решить это, но использует фиксированную структуру знаний, которая не обновляется в процессе обучения. Это приводит к низкой эффективности использования сэмплов (sample efficiency), так как агент не может использовать накопленный опыт для улучшения логики принятия решений.

Решение: Нейросимволический подход с инкрементальными знаниями

Авторы (Subrat Prasad Panda, Blaise Genest, Arvind Easwaran) предлагают архитектуру InK-HRL (Incremental Knowledge Hierarchical Reinforcement Learning). Система разделяет задачи на два уровня:

  • Высокий уровень (Символический): Использует обновляемое представление знаний (InK) и алгоритмы символического планирования (например, D*) для построения стратегии.
  • Низкий уровень (Нейросетевой): Условные нейронные модули обучаются на основе опыта, формируя примитивы движения с помощью формирования награды (reward shaping).

Ключевые метрики и результаты

Эксперименты проводились на задачах навигации. Внедрение инкрементальных знаний позволило существенно сократить количество шагов, необходимых для достижения цели по сравнению с базовыми методами. Для оптимизации планирования при наличии априорных знаний разработана структура Belief World Tree Search.

Компонент Роль в InK-HRL Технология/Алгоритм
Планирование Высокоуровневая стратегия Символический планинг (D*)
Движение Низкоуровневое управление Условные нейронные модули
Знания Хранение и обновление Инкрементальные знания (InK)
Оптимизация Поиск в пространстве состояний Belief World Tree Search

Значение для индустрии

Работа опубликована на конференции ECML-PKDD 2026. Код алгоритма доступен для воспроизведения. Подход открывает путь к созданию более автономных роботов и ИИ-агентов, способных быстро адаптироваться к новым условиям без необходимости переобучения с нуля.

Источник: arXiv cs.AI ↗