Инверсия пайплайна: от результата к запросу
Традиционные подходы к генерации данных для обучения моделей вызову инструментов (tool-use), такие как ToolBench и ToolACE, используют стратегию «запрос-первый» (query-first). Система генерирует пользовательский запрос, а затем пытается найти путь выполнения через агентский поиск (DFS). Этот метод не гарантирует успеха: если агент заходит в тупик, вычислительные ресурсы тратятся впустую, а образец отбрасывается. Исследователи из Google, Университета Токио, RIKEN AIP и Tohoku University предложили решение ToolGrad, которое переворачивает этот процесс.
ToolGrad сначала строит и верифицирует рабочую цепочку вызовов API, а затем генерирует соответствующий пользовательский запрос. Это устраняет неоднозначность и обеспечивает высокую надежность данных.
Архитектура: четыре модуля в цикле
Процесс генерации одного образца данных состоит из четырех последовательных модулей, работающих в цикле:
- API Proposer: Отбирает кандидаты на расширение текущего рабочего процесса.
- API Executors: Запускают кандидатов параллельно и формируют детальные отчеты об исполнении.
- API Selector: Выбирает лучший вызов на основе отчетов. Текстовая обратная связь от этого модуля выступает в роли «текстового градиента».
- LLM Updater: Переписывает синтетический запрос и ответ ИИ, чтобы они соответствовали обновленному набору API.
По умолчанию конфигурация выполняет 10 итераций над 50 выбранными API для каждого рабочего процесса.
Результаты генерации данных на ToolBench
Команда оценила эффективность на базе из 16 000+ реальных API. ToolGrad значительно превзошел традиционный DFS-подход по ключевым метрикам:
| Метрика | ToolBench (DFS) | ToolGrad |
|---|---|---|
| Pass Rate (Успешность) | 63.8% | 99.8% |
| Ground-truth tool uses (Длина цепочки) | 2.1 | 3.4 |
| Tool-use steps (Шагов на образец) | 34.3 | 20.0 |
| LLM invocations (Вызовов LLM) | 64.5 | 63.9 |
Единственный случай неудачи (0.2%) произошел, когда агент не смог получить успешный ответ от 3 выбранных API за 10 итераций.
BFCL: Gemma-3-12B бьет флагманы
Для проверки практической пользы был создан датасет ToolGrad-500 (500 образцов, сгенерированных Gemini 2.5 Flash-Lite). На этих данных были дообучены модели Gemma-3 размером 1B, 4B и 12B. Тестирование проводилось на Berkeley Function Calling Leaderboard (BFCL) с использованием инструментов, отсутствующих в обучающей выборке (out-of-distribution test).
Результаты оказались впечатляющими: модель Gemma-3-12B, обученная всего на 500 примерах, показала результаты, сопоставимые с проприетарными лидерами рынка:
| Модель | Результат BFCL |
|---|---|
| Gemma-3-12B (ToolGrad) | 83.1 |
| Gemini 2.5 Pro | 83.2 |
| Claude 4.5 Opus | 82.8 |
| GPT-5 | 74.4 |
Важно отметить, что студент (Gemma-3-12B) превзошел своего учителя (Gemini 2.5 Flash-Lite) и открытые специализированные модели, такие как ToolACE и Hammer-2.1-7B.
Доступность и развертывание
Проект полностью открыт. Код доступен по лицензии Apache-2.0. Датасет ToolGrad-500 и модели (1B, 4B, 12B) размещены на Hugging Face. Также доступен пакет PyPI. Репродукционные скрипты оптимизированы для BFCL V1 и V2, а тестирование проводилось на одном GPU NVIDIA A100 40GB через Docker с vLLM.
Бенчмарки
| Бенчмарк | ToolGrad | ToolGrad-12B | Claude 4.5 Opus | GPT-5 | Gemini 2.5 Pro | ToolBench DFS |
|---|---|---|---|---|---|---|
| ToolBench Pass Rate | 99.8% | — | — | — | — | 63.8% |
| Berkeley Function Calling Leaderboard | — | 83.1% | 82.8% | 74.4% | 83.2% | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
