Исследования13 августа 2026 г., 12:17 МСК🤖 Auto

InfraBench: Почему AI-агенты проваливают управление инфраструктурой

Исследователи из UW-Madison представили InfraBench — первый бенчмарк, оценивающий AI-агентов по полному циклу управления инфраструктурой. Результаты показали, что даже лучшие модели оставляют после себя «мусор» и нарушают распределенные инварианты.

Баннер новости 5693

Проблема сложности и новая метрика

Управление современной вычислительной инфраструктурой становится все более сложной задачей. Хотя AI-агенты предлагают возможность автоматизации, их способность справляться с реальными сценариями оставалась под вопросом. Команда во главе с Юанем Гао (Yuan Gao) из Университета Висконсин-Мэдисон представила InfraBench — набор для оценки агентов на задачах полного стека системы и полного жизненного цикла эксплуатации с детальной оценкой рисков.

Ключевые результаты тестирования

В исследовании протестировано 15 конфигураций агентов. Несмотря на прогресс, ни одна модель не смогла набрать полный балл. Средние эффективные оценки варьировались от 40% до 88% (со стандартной ошибкой 6-12 пунктов). Повторение задач трижды показало, что даже топовые конфигурации успешно проходят лишь часть попыток.

Метрика / Характеристика Значение / Наблюдение
Диапазон средних баллов 40% – 88%
Количество протестированных конфигураций 15
Стандартная ошибка (per-configuration) 6–12 пунктов
Основной паттерн сбоев Краткосрочные цели выполнены, но долгосрочные инварианты нарушены

Главный инсайт: «Грязь» после выполнения

Самая критичная проблема, выявленная через per-check scoring, заключается в том, что агенты часто удовлетворяют краткосрочные задачи, но оставляют после себя:

  • Недолговременные изменения (non-durable changes);
  • Нарушенные распределенные инварианты;
  • Небезопасные побочные эффекты;
  • Неочищенное состояние (uncleaned state).

Это означает, что агент может «починить» сервис на первый взгляд, но создать скрытые уязвимости или нестабильность в распределенной системе, которые проявятся позже.

Доступность ресурсов

Полный комплект InfraBench, включая живой лидерборд, набор задач и инструмент оценки, опубликован в открытом доступе. Исследование доступно по ссылке arXiv:2608.11234 (подано 31 июля 2026 года). Это важный шаг к стандартизации оценки надежности AI в критически важных инфраструктурных задачах.

Источник: arXiv cs.AI ↗