Проблема масштабирования агентов
Современные LLM-агенты демонстрируют сильные способности к рассуждению в компактных сценариях, но теряют эффективность в крупных, динамичных средах, требующих интеграции множества инструментов. Основная сложность заключается в том, что агенты не могут надежно поддерживать выполнение сложных задач с длинным горизонтом (long-horizon tasks), где ошибка на раннем этапе может сделать всю цепочку действий неэффективной.
Масштаб данных: 400 MCP и 4500 инструментов
ToolVerse автоматически генерирует исполняемые обучающие среды, используя почти 400 реальных протоколов Model Context Protocols (MCP). В совокупности это предоставляет агентам доступ к примерно 4500 различным инструментам. Для создания задач используется стратегия на основе графа зависимостей инструментов, что позволяет генерировать сложные сценарии с помощью алгоритма динамической выборки (Dynamic Unlocking Sampling Algorithm). Результатом стал датасет GUST (Graph Unlocking Sampling Tasks).
Решение проблемы распределения заслуг (Credit Assignment)
Ключевым вкладом исследования является алгоритм Turn-Aware Relative Advantage. Он предназначен для смягчения проблемы распределения заслуг в долгосрочном агентном обучении с подкреплением (Agentic RL). Алгоритм учитывает контекст каждого хода (turn), позволяя модели точнее оценивать, какие именно действия в длинной цепочке привели к успеху или провалу.
Результаты и значимость
Экстенсивное обучение с подкреплением в среде ToolVerse показало значительное усиление способностей LLM к использованию инструментов в долгосрочных задачах. Модель продемонстрировала устойчивое рассуждение в динамических средах и улучшила показатели на нескольких агентных бенчмарках. Это открывает путь к созданию более автономных систем, способных работать в реальных условиях с тысячами доступных API и сервисов.
Источник: arXiv cs.AI ↗
