Проблема фрагментации в оценке агентов
Оценка AI-агентов сталкивается с серьезной проблемой: существующие бенчмарки требуют сложных сред исполнения и уникальных интеграций, что делает сравнение моделей некорректным. Команда из 120+ авторов (включая исследователей из Google DeepMind, Berkeley и других лабораторий) представила Harbor Adapters — унифицированную инфраструктуру, которая позволяет запускать произвольных агентов на более чем 80 различных бенчмарках через единый интерфейс.
Harbor-Index: curated-набор сложных задач
Ключевым вкладом работы стал Harbor-Index — тщательно отфильтрованный набор из 82 задач, охватывающих 29 бенчмарков. Авторы применили фильтрацию по сложности, аудит с помощью ИИ и людей, а также цикл «аудит-исправление» (audit-and-fix loop). Цель — создать набор, который остается сложным, но при этом воспроизводимым и доступным для запуска.
Результаты масштабного тестирования
Команда провела оценку 8 моделей разных уровней способностей. Важно отметить, что каждая модель тестировалась с использованием Terminus-2 и трех нативных harness-ов. Результаты показывают, что современные агенты все еще далеки от решения сложных многошаговых задач:
| Модель / Конфигурация | Результат (Pass Rate) | Примечание |
|---|---|---|
| GPT-5.5 (с Codex) | 28.0% | Лучший результат на Harbor-Index |
| Другие модели (tier 1-3) | < 28.0% | Ни одна конфигурация не превысила 30% |
Это означает, что даже самые продвинутые на сегодня модели ошибаются в более чем 70% случаев на сложных, курируемых задачах, требующих планирования и взаимодействия с окружением.
Открытые артефакты
Авторы опубликовали код адаптеров, результаты оценки и сам датасет Harbor-Index в открытом доступе. Это позволяет сообществу проводить более надежные и комплексные сравнения агентов, избегая артефактов, связанных с различиями в средах исполнения.
Источник: arXiv cs.AI ↗
