Исследования15 сентября 2026 г., 08:18 МСК🤖 Auto

LLM-агенты против RL: кто эффективнее управляет физическими задачами?

Исследование показывает, что LLM-агенты в zero-shot режиме способны конкурировать с агентами на основе обучения с подкреплением (RL) в долгосрочных физических задачах, особенно при изменении условий среды.

Баннер новости 7513

Проблема адаптации в Physical AI

Большие языковые модели (LLM) открывают путь к автономному управлению долгосрочными физическими задачами без вмешательства человека. Однако реальный мир требует от агентов непрерывного наблюдения за средой, принятия решений и адаптации к изменениям. Существующие подходы либо требуют значительных объемов данных и переобучения, либо фокусируются преимущественно на виртуальных средах. Авторы работы из arXiv (2609.13436) исследуют возможность создания самоадаптивного физического ИИ-агента, работающего в режиме zero-shot.

Многоагентная архитектура

Для решения задачи разработана многоагентная архитектура, интегрирующая четыре ключевых компонента:

  • Планирование (Planning): Стратегическое распределение задач на длительном горизонте.
  • Вызов инструментов (Tool Calling): Взаимодействие с внешними системами и сенсорами.
  • Наблюдение (Observation): Анализ текущего состояния окружающей среды.
  • Верификация (Verification): Проверка корректности выполненных действий.

Эксперимент: Сельское хозяйство и погодные условия

Оценка эффективности проводилась на задачах управления сельскохозяйственными процессами. Ключевым фактором варьирования выступали различные погодные паттерны. Агенты на базе LLM сравнивались с агентами, обученными с помощью обучения с подкреплением (Reinforcement Learning, RL), в двух сценариях:

  1. Стандартные условия: Одинаковые погодные паттерны для обеих моделей.
  2. Сдвинутая среда (Shifted Environment): Изменение погодных условий, к которым RL-агент не был предварительно адаптирован.

Результаты сравнения

Исследование выявило существенные различия в устойчивости подходов к изменениям среды. LLM-агенты продемонстрировали способность к более эффективной адаптации в новых условиях по сравнению с RL-агентами, которые часто требуют дообучения при смене параметров среды.

Критерий LLM Agent (Zero-shot) RL Agent
Требования к данным Минимальные (zero-shot) Требуются большие объемы данных для обучения
Управление в стабильной среде Сопоставимые результаты Высокая эффективность
Адаптация к изменению среды Высокая (автоматическая) Низкая (требует переобучения)
Сложность развертывания Ниже (нет этапа обучения) Выше (необходимо обучение и валидация)

Значение для отрасли

Результаты подчеркивают перспективный путь развития самоадаптивного физического ИИ. Способность LLM-агентов справляться с долгосрочными задачами в изменяющейся физической среде без предварительного обучения открывает возможности для создания более гибких и универсальных систем робототехники и автоматизации, способных работать в непредсказуемых реальных условиях.

Источник: arXiv cs.AI ↗