Что такое EdgeBench и почему это важно
Лаборатория ByteDance Seed выпустила EdgeBench — комплексный набор для тестирования автономных AI-агентов. В отличие от традиционных бенчмарков, которые измеряют только способность модели выполнить задачу, EdgeBench вводит метрику interaction-time budget (бюджет времени взаимодействия). Это позволяет оценить, насколько эффективно агент использует время и вычислительные ресурсы для достижения результата, что критически важно для развертывания агентов в реальных условиях (edge devices, мобильные приложения).
Бенчмарк включает 51 задачу из различных категорий, каждая из которых имеет специфические требования к среде выполнения (runtime environment), доступу к интернету и логике оценки (judging logic). Данные доступны на Hugging Face в репозитории ByteDance-Seed/EdgeBench.
Топ моделей по эффективности (51 задача, 2 часа)
Анализ лидерборда показывает, что модели разных вендоров демонстрируют разную эффективность при ограничении времени. Ниже приведены агрегированные результаты для ключевых моделей при бюджете в 2 часа взаимодействия:
| Модель | Средний балл (2h) | Категория вендора |
|---|---|---|
| Claude Opus 4.8 | 0.89 | Anthropic |
| GPT-5.5 | 0.87 | OpenAI |
| GPT-5.4 | 0.85 | OpenAI |
| GLM-5.1 | 0.82 | THUDM (Zhipu AI) |
| DS-V4-Pro | 0.80 | DeepSeek |
Методология: От сырых данных к нормализованным оценкам
EdgeBench использует сложную систему масштабирования (rescaling) для сравнения разнородных задач. Оценки преобразуются с помощью log-sigmoid scaling curves, что позволяет нивелировать различия в сложности задач и получить нормализованные баллы. Ключевые компоненты анализа:
- Категоризация: Задачи разделены на категории (например, coding, reasoning, tool-use), что позволяет выявлять сильные и слабые стороны агентов в конкретных сценариях.
- Среда выполнения: Каждая задача запускается в изолированном Docker-контейнере с базовым образом (base_image), что гарантирует воспроизводимость результатов.
- Интернет-доступ: Часть задач требует доступа к интернету, имитируя реальные сценарии поиска информации, в то время как другие работают офлайн.
Законы масштабирования (Scaling Laws) для агентов
Исследователи применили к данным EdgeBench анализ законов масштабирования. Построение кривых log-sigmoid зависимости балла от времени взаимодействия показывает, что прирост эффективности агентов нелинеен. Существует точка перегиба, после которой увеличение бюджета времени дает убывающую отдачу. Это позволяет разработчикам оптимизировать конфигурации агентов, находя баланс между скоростью ответа и качеством решения.
Как использовать EdgeBench
Для начала работы необходимо установить зависимости и скачать датасет:
pip install huggingface_hub pandas numpy scipy matplotlib pyyaml
Затем можно загрузить данные с Hugging Face:
from huggingface_hub import snapshot_download
snapshot_download(repo_id="ByteDance-Seed/EdgeBench", repo_type="dataset")
Детальная документация и код для парсинга лидерборда доступны в репозитории, что позволяет исследователям самостоятельно проводить кастомные анализы производительности агентов.
Источник: MarkTechPost ↗
