Проблема интерактивной безопасности
Визуально-языковые модели (VLM) позволяют роботизированным агентам выполнять сложные задачи, но они часто нарушают правила безопасности. Основная сложность заключается в том, что безопасность и успешное выполнение задачи — это разные цели. Сигнал безопасности появляется лишь в редких критических шагах траектории, а стандартное обучение с подкреплением или имитацией не объясняет агенту, почему конкретное действие опасно.
Методология: Branch-Pair Safety Alignment
Команда авторов (Hyunse Lee, Jiwoo Jeong и др.) предложила фреймворк SafeBranch. Его суть в создании пар «ветвей» (branch pairs) из собственных небезопасных запусков агента. Процесс включает три этапа:
- Откат (Rollback): Траектория откатывается назад к шагу, где произошло нарушение безопасности.
- Запрос альтернативы: Агент запрашивает безопасную альтернативу действия в этой точке.
- Формирование пары: Оригинальное опасное действие и безопасная альтернатива образуют пару, differing only at that step (отличающуюся только в этом шаге).
Результаты на бенчмарках
Метод позволяет обученному агенту действовать безопасно на этапе развертывания (deployment) без использования критика (critic) в контуре. Тестирование проводилось на наборах данных IS-Bench и SafetyALFRED, включая варианты с объектами, которых агент ранее не видел (out-of-distribution).
| Метрика / Набор данных | Результат SafeBranch | Сравнение с базовой линией |
|---|---|---|
| Безопасные успехи ( unseen-object variant) | ~10x больше | Необученная базовая модель |
| Успешность выполнения задачи | Без снижения | Сохранена на уровне оригинала |
| Необходимость критика | Отсутствует | Работает автономно |
Почему это важно
SafeBranch решает проблему «размытия сигнала» при сравнении произвольных безопасных и небезопасных траекторий. Изолируя только критический шаг, метод учит агента принимать правильные решения в узких местах, не жертвуя общей эффективностью выполнения поставленной задачи. Это важный шаг к созданию надежных автономных систем в реальных условиях.
Источник: arXiv cs.AI ↗
