Исследования1 июля 2026 г., 03:16 МСК🤖 Auto

Masked IRL: Как LLM учат роботов понимать намеки и игнорировать лишнее

Исследователи MIT CSAIL представили систему Masked Inverse Reinforcement Learning, которая использует два больших языковых модели для уточнения размытых инструкций и фильтрации нерелевантной информации, сокращая потребность в демонстрациях в 5 раз.

Баннер новости 2667

Проблема «недосказанности» в робототехнике

Обучение роботов бытовым и промышленным задачам часто упирается в необходимость человека физически показывать действия (кинестетическое обучение) или писать длинные инструкции. Однако люди склонны использовать размытые формулировки, такие как «не мешай мне» или «будь ближе к столу». Без явного указания на препятствия (например, ноутбук во время видеозвонка) робот может совершить ошибку. Исследователи из MIT Computer Science and Artificial Intelligence Laboratory (CSAIL) решили эту проблему, автоматизирова процесс интерпретации намерений пользователя.

Архитектура Masked IRL: два LLM для одной задачи

Новый подход, названный Masked Inverse Reinforcement Learning (Masked IRL), использует связку из двух больших языковых моделей (LLM), работающих последовательно:

  • Первая LLM (Уточняющая): Анализирует размытый запрос пользователя и данные кинематической демонстрации (траекторию движения робота). Она «дорисовывает» детали, превращая фразу «stay close» (будь ближе) в конкретное техническое требование «stay close to the surface of the table» (придерживаться поверхности стола).
  • Вторая LLM (Фильтрующая): Оценивает элементы окружающей среды и действия робота, присваивая им баллы «1» (важно) или «0» (не важно). Например, поза человека во время демонстрации помечается как «0», а положение препятствий — как «1». Эта модель «маскирует» (игнорирует) нерелевантную информацию, оставляя только ключевые факторы для планирования движения.

Ключевые метрики и результаты

Система демонстрирует значительное превосходство над существующими базовыми моделями как в симуляциях, так и в реальных экспериментах с манипулятором. Главное преимущество — экономия данных для обучения и повышение точности интерпретации неявных предпочтений.

Метрика / Параметр Результат Masked IRL Значение для отрасли
Точность понимания неявных предпочтений На 15% выше, чем у базовых моделей Роботы реже нарушают личные границы или правила безопасности
Эффективность обучения (данные) Использует в 5 раз меньше демонстраций Снижение трудозатрат на обучение новых задач
Количество демонстраций для теста 50 кинематических демонстраций Успешное выполнение задач (перенос чашки, протирка стола) без коллизий
Обработка невидимых инструкций Корректное избегание препятствий (ноутбука, человека) Безопасное взаимодействие в динамичной среде

Практическое применение и будущее

В реальных тестах робот с системой Masked IRL успешно переносил чашку, обходя ноутбук, и вытирал стол, сохраняя близкий контакт с поверхностью, но избегая столкновений с пользователем. Авторы подчеркивают, что система минимизирует усилия человека, позволяя машинам «докапываться до сути» желаемого поведения.

В планах исследователей — добавить к системе камеры для визуального восприятия. Это позволит роботу не только анализировать траектории, но и «видеть» окружение в реальном времени, выделяя целевые объекты (например, игрушку) и игнорируя фоновые элементы (бананы на столе), что сделает взаимодействие еще более естественным.

Авторы и публикация

Работа выполнена ведущим автором Миньюн Хванг (Minyoung Hwang) и коллегами из CSAIL: Александрой Форси-Смerek, Натаниэлем Деннлером и профессором Андреа Бобу. Исследование поддержано Tata Group и Министерством обороны США. Результаты будут представлены на конференции IEEE International Conference on Robotics and Automation (ICRA) 2026 в июне.

Источник: MIT News AI ↗