Проблема «черного ящика» в Deep RL
Глубокое обучение с подкреплением (Deep Reinforcement Learning, DRL) демонстрирует выдающиеся результаты в сложных средах, однако процесс принятия решений этими агентами остается трудноинтерпретируемым. Традиционные методы атрибуции признаков часто анализируют только один временной шаг, упуская из виду долгосрочные последствия действий.
Решение: SPOT (Sampling Policy Observation Tree)
Авторы Tamar Gozlan и Claudia V. Goldman предлагают новый фреймворк SPOT. Он является модель-агностическим и использует сэмплирование для построения интерпретируемого дерева конечной горизонтали. Алгоритм работает следующим образом:
- Получает доступ к политике агента и симулятору среды.
- Сэмплирует действия и рекурсивно симулирует последующие состояния.
- Формирует эмпирическое представление предпочтений политики и их возможной эволюции.
Формальные гарантии и метрики
Исследование предоставляет строгие математические гарантии. SPOT асимптотически восстанавливает единственное наиболее вероятное действие политики. Также охарактеризовано поведение «разногласий» (disagreement) в условиях политик с высокой энтропией, что критично для понимания неопределенности агента.
Кейс-стади: Управление трафиком SUMO-RL
Эффективность SPOT продемонстрирована на домене управления светофорами SUMO-RL. Дерево представлений позволяет:
- Инспектировать предпочтения политики на разных уровнях глубины.
- Сравнивать альтернативные будущие траектории развития ситуации.
- Выявлять нисходящее поведение (downstream behaviors), которое невозможно обнаружить при анализе только текущего кадра или состояния.
Значение для индустрии
SPOT закрывает важный пробел в отладке и верификации автономных систем. Возможность «заглянуть в будущее» через дерево решений помогает инженерам не только понимать, почему агент принял решение, но и прогнозировать, к каким цепочкам событий это решение приведет, снижая риски в критических приложениях.
Источник: arXiv cs.AI ↗
