Исследования3 августа 2026 г., 12:18 МСК🤖 Auto

Model or Harness? Новая таксономия для точной диагностики ошибок AI-агентов

Исследователи представили первую «интеракционно-центричную» таксономию, разделяющую 41 тип ошибок AI-агентов по компонентам системы. Это решает проблему «назначения ремонта» и позволяет точно определить, где нужен аптайм модели, а где — исправление к

Баннер новости 4944

Проблема: «Черный ящик» сбоев

Современные оценки AI-агентов часто сводят неудачи к системному уровню, скрывая истинную причину сбоя. Возникает так называемая проблема назначения ремонта (repair-assignment problem): одна и та же видимая ошибка может требовать совершенно разных действий — от дообучения модели (post-training) до переписывания хайресса (harness) или изменения среды. Поведение агента эмерджентно и зависит от взаимодействия модели, инструментов, памяти и пользователя, поэтому простых метрик успеха/неудачи недостаточно.

Решение: Таксономия взаимодействий

Команда авторов (Harsh Raj, Vipul Gupta и др.) предложила таксономию, которая локализует ошибки на уровне ребер (edges) между компонентами системы. Каждая из 41 выявленной моды отказа привязана к конкретному взаимодействию и стороне, где требуется вмешательство:

  • Model-side failures: Цели для дообучения (post-training) или тонкой настройки.
  • Harness-side failures: Указание на необходимость исправления каркаса (scaffolding) или интеграции инструментов.
  • Environment/Grader failures: Выявление условий оценки, требующих перепроектирования.

Валидация и метрики

Таксономия протестирована на примерах из публичных бенчмарков, системных карточек моделей и логов агентов. Для проверки воспроизводимости использовались независимые reasoning-агенты в роли судей. Результаты показали высокую согласованность:

Метрика Значение Интерпретация
Cohen's κ (Каппа Коэна) 0.76 Высокая согласованность между автоматическим судейством и человеческими категориями
Количество мод отказов 41 Детализированная классификация сбоев
Охват архитектур Универсальный Применимо к coding-ассистентам, long-horizon агентам и multi-agent системам

Значение κ=0.76 свидетельствует о том, что предложенная структура категорий отражает общую логику работы систем, а не субъективные предпочтения аннотаторов. Это делает таксономию мощным инструментом для инженеров, стремящихся перейти от «гадания» к точечному улучшению AI-агентов.

Источник: arXiv cs.AI ↗