THUDM/AgentBench

A Comprehensive Benchmark to Evaluate LLMs as Agents (ICLR'24)

Агенты⭐ 3 742Python
Открыть на GitHub ↗

Что это за инструмент

AgentBench — это комплексный бенчмарк от THUDM для оценки способности больших языковых моделей (LLM) функционировать как автономные агенты в различных средах.

Зачем нужен

Инструмент позволяет измерить эффективность LLM-as-Agent через 8 различных сред, включая операционные системы, базы данных и веб-шопинг. Он полезен для исследователей и разработчиков, которые хотят объективно сравнить модели, протестировать их навыки многошагового взаимодействия и провести обучение с подкреплением (RL).

Что можно реализовать

  • Сравнительное тестирование проприетарных и открытых LLM на задачах автономного выполнения действий.
  • Запуск среды для обучения агентов с помощью RL-фреймворка AgentRL (версия FC).
  • Оценка способности моделей взаимодействовать с внешними инструментами (базы данных, графы знаний, ОС).
  • Исследование возможностей визуальных мультимодальных моделей через связанный проект VisualAgentBench.

Ключевые возможности

  • Поддержка 8 сред: OS, DB, KG, DCG, LTP, ALFWorld, WebShop, Mind2Web.
  • Наличие версии Function Calling (FC), интегрированной с фреймворком AgentRL.
  • Полная поддержка контейнеризации через Docker Compose для изолированного запуска задач.
  • Публичный Leaderboard с результатами тестирования множества моделей.
  • Наличие датасетов траекторий для обучения (behavior cloning) в VisualAgentBench.

👤 Кому подойдёт: Исследователи в области AI, разработчики LLM-агентов, специалисты по машинному обучению.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.