Исследования16 июля 2026 г., 10:17 МСК🤖 Auto

DROPJ: Обучение безопасных ИИ-агентов через предпочтения и обоснования людей

Исследователи представили метод DROPJ, позволяющий обучать безопасные ИИ-агенты в средах с неизвестной динамикой, используя симуляторы мира и объяснимые предпочтения пользователей.

Баннер новости 3703

Проблема безопасности в RL

Традиционное обучение с подкреплением (Reinforcement Learning, RL) часто неприменимо в критически важных средах, где динамика системы неизвестна, а функция вознаграждения не может быть задана априори. Риск катастрофических ошибок при обучении «вслепую» делает этот подход опасным. Авторы работы, опубликованной в arXiv (2026), предлагают решение, основанное на человеческом контроле и предсказательном моделировании.

Методология: DROPJ

Предложенный метод DROPJ (Human-centred method for safe training and deployment) состоит из нескольких этапов:

  • Обучение модели мира: На основе набора реальных траекторий строится обучаемый симулятор (world model), воспроизводящий динамику среды.
  • Генерация траекторий: Человек взаимодействует с этим симулятором, создавая информативные симулированные сценарии.
  • Сбор предпочтений: У пользователя запрашивают не только выбор лучшей пары траекторий, но и обоснование (justification) этого выбора.
  • Обучение модели вознаграждения: На основе пар «предпочтение + обоснование» обучается модель, которая затем используется для развертывания агента через модельно-предиктивное управление (MPC).

Ключевые результаты

Эксперименты с реальными пользователями показали, что использование предпочтений вместо других типов обратной связи существенно повышает эффективность развертывания. Наличие текстовых обоснований позволяет ИИ лучше понимать приоритеты безопасности, заданные пользователем.

Метрика / Аспект Результат внедрения DROPJ
Вычислительная стоимость обучения Значительное снижение за счет генерации информативных траекторий в симуляторе
Качество развертывания (Deployment) Улучшение показателей по сравнению с альтернативными стратегиями сбора данных
Роль предпочтений vs другой фидбек Предпочтения обеспечивают более высокую точность при развертывании агента
Влияние обоснований (Justifications) Существенное повышение безопасности и учет пользовательских приоритетов

Значимость для индустрии

Работа демонстрирует переход от простого «лайк/дизлайк» к объяснимому обучению (Explainable RL). В критических системах (автономный транспорт, робототехника, медицина) важно не только то, что ИИ выбрал, но и почему. DROPJ предлагает архитектуру, где человеческие ценности и логика выбора напрямую влияют на политику агента, минимизируя риски в условиях неопределенности.

Источник: arXiv cs.AI ↗