Проблема композиционного вызова инструментов
Современные агенты на базе LLM часто сталкиваются с трудностями при выполнении многошаговых задач, требующих поддержания промежуточного состояния и учета зависимостей между вызовами. Авторы исследования — Андрей Кристиан Попеску, Хайц Саэс де Окариз Борде и Питер Лио — изучили потенциал Looped Language Models (рекуррентных языковых моделей) в задачах композиционного вызова инструментов (compositional tool calling). В отличие от простых запросов, такие сценарии требуют от модели не просто вызвать API, а спланировать последовательность действий, сохранить контекст и корректно обработать результаты предыдущих шагов.
Методология и бенчмарки
Для оценки эффективности исследователи использовали три ключевых набора данных: API-Bank, BFCL (Big Function Calling Benchmark) и NESTful. Эксперименты проводились в контролируемых условиях, где сравнивались нативные и ретрофитированные (дообученные) рекуррентные модели. Важно отметить, что все модели обучались по одинаковым рецептам супервизорного дообучения (SFT), а различия в результатах были обусловлены именно архитектурой и глубиной рекуррентности (recurrent depth) во время инференса.
Ключевые результаты
Результаты показали, что рекуррентные вычисления приносят наибольшую пользу в задачах, требующих планирования и координации. В то время как для изолированных вызовов API прирост точности был незначительным и зависел от конкретной модели, для многошаговых сценариев преимущество стало очевидным. Ниже приведена сводка влияния глубины рекуррентности на производительность:
| Метрика / Сценарий | Влияние рекуррентности | Примечание |
|---|---|---|
| Изолированные вызовы API | Незначительный прирост | Зависит от базовой модели |
| Многошаговое использование (Multi-step) | Значительный рост точности | Прямая корреляция с глубиной рекуррентности |
| Адаптивный инференс | Оптимальный trade-off | Доп. вычисления только при необходимости |
Адаптивный инференс как ключ к эффективности
Особое внимание исследователи уделили методу адаптивного инференса. Вместо того чтобы всегда использовать максимальную глубину рекуррентности (что дорого по вычислительным ресурсам), модель может динамически выделять дополнительные вычисления только тогда, когда задача становится сложной. Это обеспечивает более выгодное соотношение «вычислительная мощность — производительность», делая Looped LLM практичным решением для реальных агентов.
Значение для индустрии
Работа подтверждает, что архитектура Looped LLM является перспективной основой для создания надежных агентов, способных к сложному планированию. Для разработчиков AI-систем это означает, что переход к рекуррентным паттернам обработки контекста может решить одну из главных проблем современных LLM — потерю нити повествования и ошибок в цепочках зависимых действий.
Источник: arXiv cs.AI ↗
