Исследования11 сентября 2026 г., 09:19 МСК🤖 Auto

State-Path Tool Menus: Прорыв в планировании действий AI-агентов

Исследователи представили метод State-Path Tool Menu, который повышает успешность онлайн-агентов на ToolBench с 73,7% до 89,8% за счет предиктивного построения цепочек вызовов инструментов.

Баннер новости 7248

Проблема масштабируемости инструментов

Современные языковые модели (LLM) все чаще действуют через внешние инструменты, однако практическое применение сталкивается с проблемой масштабируемости: библиотеки могут содержать тысячи интерфейсов. Существующие подходы ранжируют инструменты исключительно по релевантности запросу, что часто приводит к ошибкам в многошаговых задачах. Модель может выбрать финальное действие, но упустить или отложить вызов необходимых «производящих» инструментов, которые формируют входные данные для этого действия.

Решение: Меню как приоритет выполнения

Авторы работы (Bo Yan, Weikai Lin, Song Wang) предлагают концепцию State-Path Tool Menu. Идея заключается в том, чтобы показывать агенту не просто релевантные инструменты, а короткий, упорядоченный подмножество инструментов, которое образует полный путь от текущего состояния к желаемому результату. Это «меню» выступает в роли execution prior (приоритета выполнения), где:

  • Encoder определяет, какие инструменты доступны в текущем состоянии и как их выходные данные удовлетворяют будущие потребности.
  • Retriever находит исполняемый шаг, недостающих «производителей» и финальное действие.
  • Reranker выстраивает их в правильном порядке, ставя производителей перед потребителями.

Ключевые метрики и бенчмарки

Метод был протестирован на датасете ToolBench. Результаты демонстрируют значительное улучшение по сравнению с базовыми подходами (retrieval, reranking, generation, routing) без изменения архитектуры самого агента-исполнителя. Важно отметить, что метод сохраняет эффективность при использовании агентов с разной мощностью моделей.

Метрика / Параметр Результат / Значение
Online Success Rate (ToolBench) 0.898 (рост с 0.737)
Полнота цепочек (State-Path Menu) 32 инструмента (эффективнее официального списка из 128)
Сравнение с базовыми линиями Превосходит retrieval, reranking, generation, routing
Универсальность Успех сохраняется across executor families

Значение для индустрии

Работа, принятая в EMNLP 2026, решает фундаментальную проблему планирования в автономных агентах. Смещение фокуса с простого поиска релевантных инструментов на построение полного «пути состояния» (state-path) позволяет агентам выполнять сложные многошаговые задачи с гораздо большей надежностью. Код решения доступен в репозитории авторов.

Источник: arXiv cs.AI ↗