Проблема: Точность скрывает ненадежность
Стандартные бенчмарки сообщают о средней успешности (Mean@k), но игнорируют вопрос, который волнует бизнес: сможет ли агент выполнить ту же задачу снова? Исследование IBM на платформе AppWorld с использованием агента ReAct на базе GPT-4.1 показало пугающую статистику. При средней успешности 77,4% агент успешно выполнял задачу во всех 5 повторных запусках лишь для 53,0% задач. Этот разрыв в 24,4 процентных пункта называется consistency gap (разрыв в согласованности).
Метрика Pass^5 vs Mean@5
Ключевое отличие заключается в том, что стандартный Pass@k спрашивает, удалось ли решить задачу хотя бы один раз из k попыток. Новый подход Pass^k требует успеха во всех k попытках. Разница между этими метриками обнажает проблему «плоских» распределений вероятностей, где модель находится на грани выбора между равновероятными действиями.
| Метрика | Значение (GPT-4.1, AppWorld) | Суть измерения |
|---|---|---|
| Mean@5 | 77,4% | Средняя доля успешных задач (стандартный бенчмарк) |
| Pass^5 | 53,0% | Доля задач, решенных успешно во всех 5 запусках |
| Consistency Gap | 24,4 п.п. | Разница, показывающая уровень нестабильности агента |
Решение: ALTK-Evolve и Consistency Analyzer
IBM представила расширение системы ALTK-Evolve, которое автоматически генерирует «правила согласованности» (consistency guidelines). Процесс состоит из двух этапов:
- Диагностика (Consistency Analyzer): Система анализирует один записанный траекторию выполнения задачи. Для каждого шага принятия решения делается отдельный вызов модели с параметром k=5 (по умолчанию), чтобы проверить, как часто модель выбирает разные токены при одинаковых условиях. Это позволяет найти «хрупкие» места, где решение зависело от случайности.
- Генерация правил: На основе найденных нестабильных точек создаются текстовые инструкции. Например, вместо простого подсчета символов в заметке, агенту предписывается использовать регулярные выражения, привязанные к строкам, чтобы избежать ошибок из-за повторяющихся маркеров в легенде.
Результаты: Сокращение разрыва вдвое
Применение этих правил позволило сократить разрыв в согласованности с 24,4 до 12,0 процентных пунктов. При этом средняя точность (Mean@5) не пострадала. Это означает, что агент стал предсказуемым, не став при этом менее способным в среднем.
| Показатель | До внедрения | После внедрения Consistency Guidelines |
|---|---|---|
| Consistency Gap | 24,4 п.п. | 12,0 п.п. |
| Pass^5 (Same-task) | 53,0% | +16,0 п.п. (около 69%) |
| Pass^5 (Similar-task) | — | +13,0 п.п. |
| Средняя точность (Mean@5) | 77,4% | Без изменений |
Полная методология и технические детали описаны в отчете на arXiv. Решение позволяет перевести LLM-агентов из категории «интересных демо» в категорию «надежных инструментов» для критически важных задач, таких как финансовый аудит или проверка контрактов.
Источник: Hugging Face blog ↗
