Проблема: «Взрыв» состояний в STL
Синтез управления на основе Signal Temporal Logic (STL) позволяет формально задавать требования к системам реального времени. Однако традиционные подходы используют количественные оценки «robustness» (устойчивости) как функцию вознаграждения в обучении с подкреплением (RL). Главная проблема: эта оценка зависит от всей истории выполнения, что приводит к неуправляемому расширению пространства состояний при работе с долгосрочными спецификациями, содержащими произвольные вложенные временные операторы.
Решение: Автоматы с временными метками
Авторы работы (Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai) предлагают заменить историю на эффективный механизм памяти. Они конструируют автомат с чередованием состояний (timed alternating automaton) непосредственно из спецификаций STL. Это позволяет:
- Аугментировать пространство состояний агента локациями автомата и значениями часов.
- Выводить вознаграждения (rewards) на основе условия принятия состояний в автомате, делая процесс марковским.
Результаты: Превосходство над аналогами
Эмпирические тесты показали, что новый подход не только решает проблему вычислительной сложности, но и улучшает качество политик. Агент, обученный с использованием Reward Machines, демонстрирует более высокие показатели по следующим метрикам:
| Метрика | Преимущество метода | Причина |
|---|---|---|
| Robustness Score | Выше | Более точная обратная связь от автомата |
| Satisfaction Rate | Выше | Эффективное обучение долгосрочным зависимостям |
| Вычислительная сложность | Ниже | Марковский характер процесса (без истории) |
Значение для индустрии
Метод критически важен для автономных систем и робототехники, где отсутствуют точные модели объектов. Переход от «черного ящика» истории к структурированному автомату позволяет применять RL к более сложным сценариям, где важно соблюдение временных ограничений (например, «прибыть в зону А до того, как истечет время T, и затем покинуть зону Б»).
Источник: arXiv cs.AI ↗
