Исследования20 июля 2026 г., 09:20 МСК🤖 Auto

Превращаем RL-нейросети в читаемый Prolog: новая методика объяснимого ИИ

Исследователь Эдуардо Гарридо-Мерчан представил метод постобучения, который превращает «черный ящик» PPO-политики в исполняемую логику Prolog, сохраняя оптимальность решений.

Баннер новости 3928

От нейросети к логическому правилу

Глубокое обучение с подкреплением (Deep RL) часто критикуют за непрозрачность: модель принимает решения, но не объясняет, почему. Новая работа предлагает трехэтапный процесс постобучения (post-hoc transformation), который извлекает замороженную политику Proximal Policy Optimization (PPO) и переписывает её в виде исполняемой программы на языке Prolog. Это позволяет не только читать логику принятия решений человеком, но и запускать её на стандартных логических движках, а также редактировать правила для оптимизации.

Гарантии точности и теоретическая база

Авторы доказали четыре ключевых свойства метода. Во-первых, в конечных марковских процессах (MDP) полученная программа является проверяемым сертификатом, ограничивающим потерю награды. Во-вторых, цикл расширения базы правил монотонно улучшает результат и гарантированно завершается. В-третьих, для задач с непрерывными наблюдениями предложена процедура пороговой инстанцирования пропозициональных значений, которая конвертирует сеть с произвольной точностью при увеличении разрешения B. Ошибка несогласия снижается как O(1/B), а разрыв в награде закрывается с той же скоростью. Теоретический нижний предел показывает, что стоимость вычислений экспоненциально зависит от размерности наблюдений при наклонной границе принятия решений.

Эмпирические результаты: от точности к компромиссам

На практике метод продемонстрировал впечатляющие результаты на различных задачах. В задаче с ключом и дверью (16 944 достижимых состояний) расширенная программа Prolog достигла точного оптимального возврата во всех семах. В режиме с ограниченным бюджетом она превзошла стохастического учителя в 10 из 10 запусков. Ниже приведено сравнение эффективности на задачах непрерывного управления:

Задача Результат Prolog Сложность/Детали
Acrobot Полное совпадение с нейросетью (в пределах шума) Всего 11 логических клауз
CartPole ~97% от возврата учителя Высокая точность при простом управлении
LunarLander Частичное восстановление Результат соответствует теоретическому экспоненциальному пределу

Почему это важно

Эта работа решает фундаментальную проблему объяснимости (XAI) в RL. Превращение весов нейросети в логические правила позволяет инженерам не просто «доверять» модели, а проверять, отлаживать и улучшать её логику напрямую. Особенно важно то, что метод теоретически обосновывает пределы своей применимости: для сложных задач с высокой размерностью пространства состояний (как LunarLander) полная конвертация может быть вычислительно нецелесообразной, что помогает разработчикам выбирать правильные инструменты для своих задач.

Источник: arXiv cs.AI ↗