Реальные данные вместо синтетических тестов
Платформа Arena.ai опубликовала первый рейтинг Agent Arena Leaderboard, который кардинально отличается от традиционных бенчмарков. Вместо парных голосований пользователей или синтетических задач, рейтинг построен на анализе миллионов реальных взаимодействий в режиме Agent Mode на платформе arena.ai/agent. Пользователи решают сложные задачи по программированию, финансовому анализу и другим профессиональным направлениям, что позволяет оценить агентов в условиях реального рабочего процесса.
Методология: Causal Tracing
Ключевым нововведением стала методология causal tracing (причинно-следственный анализ). Агент рассматривается как многокомпонентная система, где каждый выбор модели или инструмента — это «лечение» (treatment). Алгоритм измеряет такие сигналы, как успешность задач, восстановление после ошибок, галлюцинации инструментов и обратную связь пользователя, создавая рандомизированное контролируемое испытание. Результат выражается в метрике Net Improvement (τ̂), которая показывает причинно-следственное улучшение производительности агента.
Топ-3 модели по совокупному показателю
Лидерство в общем рейтинге заняли модели, демонстрирующие высокую способность к выполнению задач и корректной работе с инструментами. Ниже представлены три лучшие модели по агрегированному показателю Net Improvement:
| Модель | Net Improvement (τ̂) | Подтвержденный успех | Восстановление Bash | Галлюцинации инструментов |
|---|---|---|---|---|
| GPT 5.5 (High) | 10.66% | 7.06% | 17.73% | 1.52% |
| Claude Opus 4.7 (Thinking) | 9.47% | 7.95% | 16.69% | 1.49% |
| GPT 5.4 (High) | 8.92% | 6.89% | 16.34% | 1.52% |
Пять ключевых метрик эффективности
Рейтинг формируется на основе пяти конкретных сигналов, извлеченных из реальных сессий:
- Confirmed Success: Окончательная оценка пользователем (кнопки approve/disapprove) после завершения траектории задачи.
- Praise vs. Complaint: Соотношение явных похвал («отлично», «именно это нужно») и жалоб («сломалось», «не понял») в текстовом диалоге.
- Steerability: Способность агента исправлять ошибки по прямым указаниям пользователя («сделай X вместо Y»). Успех фиксируется, если пользователь принимает исправление.
- Bash Recovery: Количество шагов, необходимых агенту для восстановления после ошибки в bash-команде (не связанной с окружением). Провал или отказ оцениваются штрафом.
- Tool Hallucination: Частота вызова несуществующих инструментов, некорректного синтаксиса или утечки токенов цепочки мышления в поле вызова инструмента.
Стоимость против производительности
Отдельно Arena.ai проанализировала парето-оптимальность, рассчитав фактическую стоимость сессии, которая может отличаться от заявленной из-за количества шагов и итераций. GPT 5.5 (High) и Claude Opus 4.7 (Thinking) демонстрируют высокую эффективность, оправдывающую их стоимость в сложных сценариях, в то время как некоторые более дешевые модели (например, Grok 4.3 или Gemma 4 31B) показывают отрицательный Net Improvement, что указывает на низкую полезность в реальных рабочих процессах.
Источник: Arena ↗
