Исследования18 августа 2026 г., 02:18 МСК🤖 Auto

Signal Temporal Logic через Reward Machines: прорыв в RL-управлении

Исследователи представили метод Reward Machines, который решает проблему взрыва состояния в обучении с подкреплением для сложных временных спецификаций STL.

Баннер новости 5958

Проблема: «Взрыв» состояний в STL

Синтез управления на основе Signal Temporal Logic (STL) позволяет формально задавать требования к системам реального времени. Однако традиционные подходы используют количественные оценки «robustness» (устойчивости) как функцию вознаграждения в обучении с подкреплением (RL). Главная проблема: эта оценка зависит от всей истории выполнения, что приводит к неуправляемому расширению пространства состояний при работе с долгосрочными спецификациями, содержащими произвольные вложенные временные операторы.

Решение: Автоматы с временными метками

Авторы работы (Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai) предлагают заменить историю на эффективный механизм памяти. Они конструируют автомат с чередованием состояний (timed alternating automaton) непосредственно из спецификаций STL. Это позволяет:

  • Аугментировать пространство состояний агента локациями автомата и значениями часов.
  • Выводить вознаграждения (rewards) на основе условия принятия состояний в автомате, делая процесс марковским.

Результаты: Превосходство над аналогами

Эмпирические тесты показали, что новый подход не только решает проблему вычислительной сложности, но и улучшает качество политик. Агент, обученный с использованием Reward Machines, демонстрирует более высокие показатели по следующим метрикам:

Метрика Преимущество метода Причина
Robustness Score Выше Более точная обратная связь от автомата
Satisfaction Rate Выше Эффективное обучение долгосрочным зависимостям
Вычислительная сложность Ниже Марковский характер процесса (без истории)

Значение для индустрии

Метод критически важен для автономных систем и робототехники, где отсутствуют точные модели объектов. Переход от «черного ящика» истории к структурированному автомату позволяет применять RL к более сложным сценариям, где важно соблюдение временных ограничений (например, «прибыть в зону А до того, как истечет время T, и затем покинуть зону Б»).

Источник: arXiv cs.AI ↗