Проблема сложности и новая метрика
Управление современной вычислительной инфраструктурой становится все более сложной задачей. Хотя AI-агенты предлагают возможность автоматизации, их способность справляться с реальными сценариями оставалась под вопросом. Команда во главе с Юанем Гао (Yuan Gao) из Университета Висконсин-Мэдисон представила InfraBench — набор для оценки агентов на задачах полного стека системы и полного жизненного цикла эксплуатации с детальной оценкой рисков.
Ключевые результаты тестирования
В исследовании протестировано 15 конфигураций агентов. Несмотря на прогресс, ни одна модель не смогла набрать полный балл. Средние эффективные оценки варьировались от 40% до 88% (со стандартной ошибкой 6-12 пунктов). Повторение задач трижды показало, что даже топовые конфигурации успешно проходят лишь часть попыток.
| Метрика / Характеристика | Значение / Наблюдение |
|---|---|
| Диапазон средних баллов | 40% – 88% |
| Количество протестированных конфигураций | 15 |
| Стандартная ошибка (per-configuration) | 6–12 пунктов |
| Основной паттерн сбоев | Краткосрочные цели выполнены, но долгосрочные инварианты нарушены |
Главный инсайт: «Грязь» после выполнения
Самая критичная проблема, выявленная через per-check scoring, заключается в том, что агенты часто удовлетворяют краткосрочные задачи, но оставляют после себя:
- Недолговременные изменения (non-durable changes);
- Нарушенные распределенные инварианты;
- Небезопасные побочные эффекты;
- Неочищенное состояние (uncleaned state).
Это означает, что агент может «починить» сервис на первый взгляд, но создать скрытые уязвимости или нестабильность в распределенной системе, которые проявятся позже.
Доступность ресурсов
Полный комплект InfraBench, включая живой лидерборд, набор задач и инструмент оценки, опубликован в открытом доступе. Исследование доступно по ссылке arXiv:2608.11234 (подано 31 июля 2026 года). Это важный шаг к стандартизации оценки надежности AI в критически важных инфраструктурных задачах.
Источник: arXiv cs.AI ↗
