От нейросети к логическому правилу
Глубокое обучение с подкреплением (Deep RL) часто критикуют за непрозрачность: модель принимает решения, но не объясняет, почему. Новая работа предлагает трехэтапный процесс постобучения (post-hoc transformation), который извлекает замороженную политику Proximal Policy Optimization (PPO) и переписывает её в виде исполняемой программы на языке Prolog. Это позволяет не только читать логику принятия решений человеком, но и запускать её на стандартных логических движках, а также редактировать правила для оптимизации.
Гарантии точности и теоретическая база
Авторы доказали четыре ключевых свойства метода. Во-первых, в конечных марковских процессах (MDP) полученная программа является проверяемым сертификатом, ограничивающим потерю награды. Во-вторых, цикл расширения базы правил монотонно улучшает результат и гарантированно завершается. В-третьих, для задач с непрерывными наблюдениями предложена процедура пороговой инстанцирования пропозициональных значений, которая конвертирует сеть с произвольной точностью при увеличении разрешения B. Ошибка несогласия снижается как O(1/B), а разрыв в награде закрывается с той же скоростью. Теоретический нижний предел показывает, что стоимость вычислений экспоненциально зависит от размерности наблюдений при наклонной границе принятия решений.
Эмпирические результаты: от точности к компромиссам
На практике метод продемонстрировал впечатляющие результаты на различных задачах. В задаче с ключом и дверью (16 944 достижимых состояний) расширенная программа Prolog достигла точного оптимального возврата во всех семах. В режиме с ограниченным бюджетом она превзошла стохастического учителя в 10 из 10 запусков. Ниже приведено сравнение эффективности на задачах непрерывного управления:
| Задача | Результат Prolog | Сложность/Детали |
|---|---|---|
| Acrobot | Полное совпадение с нейросетью (в пределах шума) | Всего 11 логических клауз |
| CartPole | ~97% от возврата учителя | Высокая точность при простом управлении |
| LunarLander | Частичное восстановление | Результат соответствует теоретическому экспоненциальному пределу |
Почему это важно
Эта работа решает фундаментальную проблему объяснимости (XAI) в RL. Превращение весов нейросети в логические правила позволяет инженерам не просто «доверять» модели, а проверять, отлаживать и улучшать её логику напрямую. Особенно важно то, что метод теоретически обосновывает пределы своей применимости: для сложных задач с высокой размерностью пространства состояний (как LunarLander) полная конвертация может быть вычислительно нецелесообразной, что помогает разработчикам выбирать правильные инструменты для своих задач.
Источник: arXiv cs.AI ↗
