Проблема безопасности в RL
Традиционное обучение с подкреплением (Reinforcement Learning, RL) часто неприменимо в критически важных средах, где динамика системы неизвестна, а функция вознаграждения не может быть задана априори. Риск катастрофических ошибок при обучении «вслепую» делает этот подход опасным. Авторы работы, опубликованной в arXiv (2026), предлагают решение, основанное на человеческом контроле и предсказательном моделировании.
Методология: DROPJ
Предложенный метод DROPJ (Human-centred method for safe training and deployment) состоит из нескольких этапов:
- Обучение модели мира: На основе набора реальных траекторий строится обучаемый симулятор (world model), воспроизводящий динамику среды.
- Генерация траекторий: Человек взаимодействует с этим симулятором, создавая информативные симулированные сценарии.
- Сбор предпочтений: У пользователя запрашивают не только выбор лучшей пары траекторий, но и обоснование (justification) этого выбора.
- Обучение модели вознаграждения: На основе пар «предпочтение + обоснование» обучается модель, которая затем используется для развертывания агента через модельно-предиктивное управление (MPC).
Ключевые результаты
Эксперименты с реальными пользователями показали, что использование предпочтений вместо других типов обратной связи существенно повышает эффективность развертывания. Наличие текстовых обоснований позволяет ИИ лучше понимать приоритеты безопасности, заданные пользователем.
| Метрика / Аспект | Результат внедрения DROPJ |
|---|---|
| Вычислительная стоимость обучения | Значительное снижение за счет генерации информативных траекторий в симуляторе |
| Качество развертывания (Deployment) | Улучшение показателей по сравнению с альтернативными стратегиями сбора данных |
| Роль предпочтений vs другой фидбек | Предпочтения обеспечивают более высокую точность при развертывании агента |
| Влияние обоснований (Justifications) | Существенное повышение безопасности и учет пользовательских приоритетов |
Значимость для индустрии
Работа демонстрирует переход от простого «лайк/дизлайк» к объяснимому обучению (Explainable RL). В критических системах (автономный транспорт, робототехника, медицина) важно не только то, что ИИ выбрал, но и почему. DROPJ предлагает архитектуру, где человеческие ценности и логика выбора напрямую влияют на политику агента, минимизируя риски в условиях неопределенности.
Источник: arXiv cs.AI ↗
