Проблема: «Черный ящик» сбоев
Современные оценки AI-агентов часто сводят неудачи к системному уровню, скрывая истинную причину сбоя. Возникает так называемая проблема назначения ремонта (repair-assignment problem): одна и та же видимая ошибка может требовать совершенно разных действий — от дообучения модели (post-training) до переписывания хайресса (harness) или изменения среды. Поведение агента эмерджентно и зависит от взаимодействия модели, инструментов, памяти и пользователя, поэтому простых метрик успеха/неудачи недостаточно.
Решение: Таксономия взаимодействий
Команда авторов (Harsh Raj, Vipul Gupta и др.) предложила таксономию, которая локализует ошибки на уровне ребер (edges) между компонентами системы. Каждая из 41 выявленной моды отказа привязана к конкретному взаимодействию и стороне, где требуется вмешательство:
- Model-side failures: Цели для дообучения (post-training) или тонкой настройки.
- Harness-side failures: Указание на необходимость исправления каркаса (scaffolding) или интеграции инструментов.
- Environment/Grader failures: Выявление условий оценки, требующих перепроектирования.
Валидация и метрики
Таксономия протестирована на примерах из публичных бенчмарков, системных карточек моделей и логов агентов. Для проверки воспроизводимости использовались независимые reasoning-агенты в роли судей. Результаты показали высокую согласованность:
| Метрика | Значение | Интерпретация |
|---|---|---|
| Cohen's κ (Каппа Коэна) | 0.76 | Высокая согласованность между автоматическим судейством и человеческими категориями |
| Количество мод отказов | 41 | Детализированная классификация сбоев |
| Охват архитектур | Универсальный | Применимо к coding-ассистентам, long-horizon агентам и multi-agent системам |
Значение κ=0.76 свидетельствует о том, что предложенная структура категорий отражает общую логику работы систем, а не субъективные предпочтения аннотаторов. Это делает таксономию мощным инструментом для инженеров, стремящихся перейти от «гадания» к точечному улучшению AI-агентов.
Источник: arXiv cs.AI ↗
