Исследования21 августа 2026 г., 11:18 МСК🤖 Auto

SafeBranch: Как обучить роботов безопасности без критика

Исследователи представили SafeBranch — метод выравнивания embodied-агентов на основе пар ветвей, который увеличивает число безопасных выполнений задач в 10 раз.

Баннер новости 6222

Проблема интерактивной безопасности

Визуально-языковые модели (VLM) позволяют роботизированным агентам выполнять сложные задачи, но они часто нарушают правила безопасности. Основная сложность заключается в том, что безопасность и успешное выполнение задачи — это разные цели. Сигнал безопасности появляется лишь в редких критических шагах траектории, а стандартное обучение с подкреплением или имитацией не объясняет агенту, почему конкретное действие опасно.

Методология: Branch-Pair Safety Alignment

Команда авторов (Hyunse Lee, Jiwoo Jeong и др.) предложила фреймворк SafeBranch. Его суть в создании пар «ветвей» (branch pairs) из собственных небезопасных запусков агента. Процесс включает три этапа:

  • Откат (Rollback): Траектория откатывается назад к шагу, где произошло нарушение безопасности.
  • Запрос альтернативы: Агент запрашивает безопасную альтернативу действия в этой точке.
  • Формирование пары: Оригинальное опасное действие и безопасная альтернатива образуют пару, differing only at that step (отличающуюся только в этом шаге).

Результаты на бенчмарках

Метод позволяет обученному агенту действовать безопасно на этапе развертывания (deployment) без использования критика (critic) в контуре. Тестирование проводилось на наборах данных IS-Bench и SafetyALFRED, включая варианты с объектами, которых агент ранее не видел (out-of-distribution).

Метрика / Набор данных Результат SafeBranch Сравнение с базовой линией
Безопасные успехи ( unseen-object variant) ~10x больше Необученная базовая модель
Успешность выполнения задачи Без снижения Сохранена на уровне оригинала
Необходимость критика Отсутствует Работает автономно

Почему это важно

SafeBranch решает проблему «размытия сигнала» при сравнении произвольных безопасных и небезопасных траекторий. Изолируя только критический шаг, метод учит агента принимать правильные решения в узких местах, не жертвуя общей эффективностью выполнения поставленной задачи. Это важный шаг к созданию надежных автономных систем в реальных условиях.

Источник: arXiv cs.AI ↗