THUDM/AgentBench
A Comprehensive Benchmark to Evaluate LLMs as Agents (ICLR'24)
Агенты⭐ 3 742Python
Что это за инструмент
AgentBench — это комплексный бенчмарк от THUDM для оценки способности больших языковых моделей (LLM) функционировать как автономные агенты в различных средах.
Зачем нужен
Инструмент позволяет измерить эффективность LLM-as-Agent через 8 различных сред, включая операционные системы, базы данных и веб-шопинг. Он полезен для исследователей и разработчиков, которые хотят объективно сравнить модели, протестировать их навыки многошагового взаимодействия и провести обучение с подкреплением (RL).
Что можно реализовать
- Сравнительное тестирование проприетарных и открытых LLM на задачах автономного выполнения действий.
- Запуск среды для обучения агентов с помощью RL-фреймворка AgentRL (версия FC).
- Оценка способности моделей взаимодействовать с внешними инструментами (базы данных, графы знаний, ОС).
- Исследование возможностей визуальных мультимодальных моделей через связанный проект VisualAgentBench.
Ключевые возможности
- Поддержка 8 сред: OS, DB, KG, DCG, LTP, ALFWorld, WebShop, Mind2Web.
- Наличие версии Function Calling (FC), интегрированной с фреймворком AgentRL.
- Полная поддержка контейнеризации через Docker Compose для изолированного запуска задач.
- Публичный Leaderboard с результатами тестирования множества моделей.
- Наличие датасетов траекторий для обучения (behavior cloning) в VisualAgentBench.
👤 Кому подойдёт: Исследователи в области AI, разработчики LLM-агентов, специалисты по машинному обучению.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.