Инструменты7 сентября 2026 г., 07:19 МСК🤖 Auto

Harbor-Index: Новый стандарт оценки AI-агентов с проходимостью <30%

Исследователи представили Harbor Adapters и Harbor-Index — инфраструктуру и метадатасет для оценки 80+ бенчмарков. Лучшая модель GPT-5.5 набрала лишь 28% на сложных задачах.

Баннер новости 6908

Проблема фрагментации в оценке агентов

Оценка AI-агентов сталкивается с серьезной проблемой: существующие бенчмарки требуют сложных сред исполнения и уникальных интеграций, что делает сравнение моделей некорректным. Команда из 120+ авторов (включая исследователей из Google DeepMind, Berkeley и других лабораторий) представила Harbor Adapters — унифицированную инфраструктуру, которая позволяет запускать произвольных агентов на более чем 80 различных бенчмарках через единый интерфейс.

Harbor-Index: curated-набор сложных задач

Ключевым вкладом работы стал Harbor-Index — тщательно отфильтрованный набор из 82 задач, охватывающих 29 бенчмарков. Авторы применили фильтрацию по сложности, аудит с помощью ИИ и людей, а также цикл «аудит-исправление» (audit-and-fix loop). Цель — создать набор, который остается сложным, но при этом воспроизводимым и доступным для запуска.

Результаты масштабного тестирования

Команда провела оценку 8 моделей разных уровней способностей. Важно отметить, что каждая модель тестировалась с использованием Terminus-2 и трех нативных harness-ов. Результаты показывают, что современные агенты все еще далеки от решения сложных многошаговых задач:

Модель / Конфигурация Результат (Pass Rate) Примечание
GPT-5.5 (с Codex) 28.0% Лучший результат на Harbor-Index
Другие модели (tier 1-3) < 28.0% Ни одна конфигурация не превысила 30%

Это означает, что даже самые продвинутые на сегодня модели ошибаются в более чем 70% случаев на сложных, курируемых задачах, требующих планирования и взаимодействия с окружением.

Открытые артефакты

Авторы опубликовали код адаптеров, результаты оценки и сам датасет Harbor-Index в открытом доступе. Это позволяет сообществу проводить более надежные и комплексные сравнения агентов, избегая артефактов, связанных с различиями в средах исполнения.

Источник: arXiv cs.AI ↗