Главная/Блог/Гайд/ToolGrad: Революция в генерации данных…
Гайд7 мин чтения · 11 сентября 2026 г.

ToolGrad: Революция в генерации данных для вызова инструментов ИИ

Исследователи Google представили ToolGrad — фреймворк, переворачивающий подход к созданию датасетов для обучения LLM. Пропускная способность достигает 99,8%, а модели Gemma-3 показывают результаты на уровне проприетарных гигантов.

ToolGrad: Революция в генерации данных для вызова инструментов ИИ

В мире больших языковых моделей (LLM) способность точно вызывать внешние инструменты — от поиска в интернете до выполнения сложных вычислений — стала критически важным навыком. Однако обучение этих моделей требует огромных объемов качественных данных, которые парят пользовательские запросы с правильными цепочками вызовов инструментов. Традиционные методы создания таких датасетов были медленными, дорогими и неэффективными. На сцену выходит новый подход от команды исследователей Google, Университета Токио, RIKEN AIP и Университета Тохоку. Они представили ToolGrad — фреймворк, который инвертирует стандартный процесс: сначала создается проверенная цепочка вызовов инструментов, а затем пишется запрос пользователя. Результаты впечатляют: модели Gemma-3, дообученные всего на 500 образцах данных, сгенерированных ToolGrad, показывают результаты, сопоставимые с передовыми проприетарными моделями на Berkeley Function Calling Leaderboard (BFCL).

Этот прорыв не просто теоретический. Код проекта доступен под лицензией Apache-2.0, датасет ToolGrad-500 и модели размером 1B, 4B и 12B параметров уже размещены на Hugging Face, а также доступен пакет PyPI для легкой интеграции. В этой статье мы подробно разберем, как работает ToolGrad, почему старый подход «запрос-первый» оказался тупиковым, и что это значит для разработчиков ИИ в России и мире.

01Проблема «Запрос-первый»: почему старые методы неэффективны

Чтобы понять масштаб инновации ToolGrad, нужно сначала разобраться в проблемах существующих пайплайнов генерации данных. Большинство предыдущих подходов, таких как ToolBench и ToolACE, следовали так называемому рецепту «запрос-первый» (query-first). Этот процесс выглядел следующим образом: система выбирала пул API, просила LLM придумать правдоподобную инструкцию пользователя, а затем запускала агента с поиском в глубину (DFS), чтобы найти путь использования инструментов, который удовлетворил бы этот запрос.

Главная проблема этого метода заключается в отсутствии гарантий успеха. Поиск в глубину — это слепой перебор вариантов. Когда агент заходит в тупик, вычислительные ресурсы, потраченные на исследование, оказываются потраченными впустую, а весь образец данных отбрасывается. Исследователи называют этот процесс дистилляцией ценных траекторий из сложного и часто терпящего неудачу исследования агента, что является inherently неэффективным. По сути, мы тратим много вычислений на то, чтобы получить мало полезных данных.

⚠️
Важно. В традиционных подходах до 36% попыток генерации данных могли быть отброшены из-за того, что агент не мог найти рабочий путь вызова инструментов. Это создавало узкое горлышко в масштабировании обучения.

02ToolGrad: Инверсия процесса

ToolGrad решает эту проблему, полностью меняя порядок действий. Вместо того чтобы начинать с гипотетического запроса пользователя, система сначала строит истинную цепочку вызовов инструментов, фактически выполняя API. Только после того, как рабочая цепочка создана, она аннотируется соответствующим запросом пользователя. Поскольку явная, рабочая цепочка гораздо менее неоднозначна, чем гипотетический промпт, шаг от цепочки к запросу занимает всего один вызов LLM. Это радикально повышает эффективность и надежность генерации данных.

Четыре модуля в цикле

Каждая итерация генерации данных в ToolGrad состоит из четырех модулей, работающих в последовательности:

  1. API Proposer (Предложитель API): Сужает выборку выбранных API до нескольких кандидатов, которые могут расширить текущий рабочий процесс. Этот модуль определяет, какие инструменты логично добавить к уже существующей цепочке.
  2. API Executors (Исполнители API): Запускают этих кандидатов параллельно и производят подробные отчеты об исполнении. Здесь происходит фактическое взаимодействие с внешними сервисами для проверки работоспособности.
  3. API Selector (Селектор API): Просматривает отчеты, выбирает единственный лучший вызов и добавляет его в рабочий процесс. Его направленная обратная связь является текстовым градиентом, который направляет обучение.
  4. LLM Updater (Обновитель LLM): Переписывает синтетический запрос пользователя и ответ ИИ так, чтобы они соответствовали новому набору API. Это гарантирует, что финальный запрос логически ведет к созданной цепочке.

Повторение этого цикла дает один образец: запрос пользователя, проверенный рабочий процесс API и финальный ответ. По умолчанию конфигурация репозитория запускает 10 итераций над 50 выбранными API для каждого рабочего процесса. Такой подход гарантирует, что каждый образец данных в датасете является не только правдоподобным, но и технически рабочим.

ToolGrad: Революция в генерации данных для вызова инструментов ИИ
💡
Совет. Если вы планируете использовать ToolGrad для своих задач, обратите внимание, что количество итераций и размер выборки API можно настраивать. Для начального тестирования достаточно стандартных параметров, но для специфических доменов стоит увеличить разнообразие API.

03Эффективность генерации данных на ToolBench

Команда исследователей оценила генерацию данных на базе API ToolBench, которая содержит более 16 000 реальных API. Они сравнили ToolGrad с подходом на основе поиска в глубину (DFS) из ToolBench. Результаты были ошеломляющими:

  • Пропускная способность (Pass rate): Увеличилась с 63,8% (DFS) до 99,8% (ToolGrad). Это означает, что почти каждый сгенерированный образец данных является рабочим.
  • Истинные вызовы инструментов на образец: Увеличились с 2,1 до 3,4. Это говорит о том, что ToolGrad генерирует более длинные и сложные цепочки, что полезно для обучения модели более сложным сценариям.
  • Шаги вызова инструментов на образец: Сократились с 34,3 до 20,0. Это критически важное улучшение, так как оно означает меньшее количество вычислительных затрат на создание одного образца.
  • Вызовы LLM на образец: Слегка снизились с 64,5 до 63,9, что делает процесс еще более экономичным.

Единственный случай неудачи (0,2%) произошел, когда агент не смог получить успешный ответ от 3 выбранных API за все 10 итераций, и был сохранен пустой образец. Это демонстрирует высокую надежность системы.

04Результаты на Berkeley Function Calling Leaderboard (BFCL)

Самым впечатляющим доказательством эффективности ToolGrad стали результаты обучения моделей. Исследователи сгенерировали датасет ToolGrad-500, состоящий из 500 образцов, созданных с помощью Gemini 2.5 Flash-Lite, и использовали его для пост-обучения моделей Gemma-3 размером 1B, 4B и 12B параметров. Оценка проводилась на Berkeley Function Calling Leaderboard, который использует набор инструментов, отличный от ToolBench. Это делает тестирование тестом «вне распределения» (out-of-distribution) с неизученными инструментами, что является строгим показателем обобщающей способности модели.

Результаты,reported авторами, показали:

  • Дообучение на ToolGrad-500 улучшило показатели использования инструментов на каждом размере параметров.
  • ToolGrad-12B набрал 83,1 балла, что сравнимо с Gemini 2.5 Pro (83,2), Claude 4.5 Opus (82,8) и значительно превосходит GPT-5 (74,4) на момент публикации.
  • Студенческая модель 12B превзошла учителя Gemini 2.5 Flash-Lite, которая сгенерировала ее обучающие данные. Это классический пример того, как качество данных может превзойти качество учителя.
  • ToolGrad-12B лидировал среди открытых специалистов по использованию инструментов, включая ToolACE и Hammer-2.1-7B.
📌
Факт. Скрипты воспроизведения репозитория нацелены на BFCL V1 и V2 через пользовательский форк, запускают вывод в Docker-образе vLLM и были проверены на одном NVIDIA A100 40GB. Это делает эксперименты доступными даже для исследователей с ограниченным доступом к мощным кластерам.

05Доступность и локальный запуск

Одним из ключевых преимуществ ToolGrad является его открытость. Код доступен под лицензией Apache-2.0, что позволяет свободно использовать, модифицировать и распространять его. Датасет ToolGrad-500 и модели Gemma-3 (1B, 4B, 12B) доступны на Hugging Face. Для разработчиков из России это особенно важно, так как позволяет обходить потенциальные ограничения на доступ к некоторым зарубежным сервисам, используя локальные ресурсы.

ToolGrad: Революция в генерации данных для вызова инструментов ИИ

Для запуска локально вам потребуется:

  1. Установить Python и зависимости из PyPI пакета.
  2. Скачать модели с Hugging Face.
  3. Использовать Docker-образ vLLM для эффективного вывода.

Это снижает порог входа для исследователей и разработчиков, позволяя им экспериментировать с передовыми методами генерации данных без необходимости доступа к закрытым API крупных корпораций.

06Что это значит на практике

Для разработчиков ИИ и исследователей ToolGrad представляет собой не просто еще один инструмент, а новый стандарт в создании данных для обучения моделей вызова инструментов. Вот ключевые выводы:

  • Качество важнее количества: Всего 500 образцов данных, сгенерированных ToolGrad, позволили модели Gemma-3-12B достичь результатов, сопоставимых с Gemini 2.5 Pro. Это доказывает, что правильно сгенерированные данные могут быть более эффективными, чем огромные, но зашумленные датасеты.
  • Эффективность вычислений: Снижение количества шагов вызова инструментов и вызовов LLM на образец делает процесс генерации данных дешевле и быстрее. Это открывает путь к созданию больших датасетов для специфических доменов.
  • Открытость и доступность: Наличие кода, датасета и моделей на открытых платформах позволяет сообществу быстро внедрять эти методы. Локальный запуск на одном GPU делает его доступным для небольших команд и индивидуальных исследователей.
  • Обобщающая способность: Успех на BFCL, который использует неизученные инструменты, показывает, что модели, обученные на ToolGrad, лучше понимают логику вызова инструментов в целом, а не просто запоминают конкретные API.

В заключение, ToolGrad — это значительный шаг вперед в области обучения LLM работе с инструментами. Он решает фундаментальные проблемы эффективности и надежности генерации данных, предлагая открытый и доступный путь к созданию высококачественных моделей. Для разработчиков, работающих над интеграцией ИИ в реальные приложения, это означает возможность создавать более надежные и умные системы с меньшими затратами ресурсов. Следите за развитием проекта, экспериментируйте с датасетом и моделями, и будьте в курсе новых открытий в области искусственного интеллекта.

Исследователи продолжают работу над улучшением фреймворка, и мы ожидаем появления новых версий с еще большей эффективностью и поддержкой большего количества инструментов. Подписывайтесь на наши обновления, чтобы не пропустить следующие новости из мира AI.

Источник: MarkTechPost ↗