ShishirPatil/gorilla

Gorilla: Обучение и оценка LLM для вызова функций (Tool Calls)

Инструменты⭐ 13 037Pythonпоследний релиз: v1.3
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Gorilla — это набор моделей с открытым исходным кодом, обученных для выполнения вызовов функций (function calls) и взаимодействия с большими наборами API на основе естественного языка.

Зачем нужен

Инструмент решает задачу автоматизации взаимодействия LLM с внешними сервисами, позволяя моделям генерировать корректные синтаксические и семантические вызовы API. Это полезно для создания автономных агентов, которые могут выполнять сложные задачи, используя доступные инструменты, без необходимости ручного написания кода для каждого API.

Что можно реализовать

  • Создание агентов, которые самостоятельно ищут информацию в интернете или управляют базами данных через API.
  • Разработка систем RAG (Retrieval-Augmented Generation), где модель динамически подтягивает данные из внешних источников.
  • Автоматизация финансовых или аналитических задач через вызов специализированных API.
  • Тестирование и оценка способности различных LLM выполнять многошаговые вызовы функций (multi-turn function calling).

Ключевые возможности

  • Наличие Berkeley Function Calling Leaderboard (BFCL) для объективной оценки моделей в задачах вызова функций.
  • Поддержка сложных сценариев: многошаговые вызовы, работа с состоянием сервисов и восстановление после ошибок.
  • Инструмент GoEx для выполнения сгенерированных действий с механизмами безопасности (undo, damage confinement).
  • Открытые модели (Apache 2.0) и датасеты (APIBench) для обучения иfine-tuning собственных решений.

👤 Кому подойдёт: Исследователи в области NLP, разработчики AI-агентов и инженеры, работающие с интеграцией LLM в бизнес-процессы через API.

Релизы

v1.3major
🕐 14 мес назад · релиз на GitHub ↗

Релиз BFCL v3 с поддержкой многошаговых вызовов, добавлена поддержка новых моделей (Gemma-3, DeepSeek-R1, Qwen2.5) и исправления.

  • Added: Выпущен стабильный Berkeley Function Calling Leaderboard V3 с оценкой многошаговых и многотуровых вызовов функций.
  • Added: Добавлена поддержка новых моделей: Gemma-3, DeepSeek-R1, Qwen2.5, QwQ, Sky-T1, Falcon3, Cohere Command A и других.
  • Fixed: Исправлены ошибки в обработчиках Amazon Nova, опечатки в эталонных данных и проблемы с параллельным выполнением тестов.
  • Added: Добавлены обработчики и метаданные для моделей Bielik, ToolACE-2-8B, Bitagent 8b и CoALM.
  • Fixed: Улучшена структура репозитория: перенесены файлы конфигурации в папку constants, исправлены пути импорта и зависимости.