Инструменты15 сентября 2026 г., 19:18 МСК🤖 Auto

IBM: Точность LLM-агентов — иллюзия. Новый метод ALTK-Evolve решает проблему нестабильности

Исследователи IBM выявили критический разрыв между средней успешностью и повторяемостью действий LLM-агентов. Представлен инструмент Consistency Analyzer, сокращающий «разрыв в согласованности» почти вдвое без потери общей точности.

Баннер новости 7550

Проблема: Точность скрывает ненадежность

Стандартные бенчмарки сообщают о средней успешности (Mean@k), но игнорируют вопрос, который волнует бизнес: сможет ли агент выполнить ту же задачу снова? Исследование IBM на платформе AppWorld с использованием агента ReAct на базе GPT-4.1 показало пугающую статистику. При средней успешности 77,4% агент успешно выполнял задачу во всех 5 повторных запусках лишь для 53,0% задач. Этот разрыв в 24,4 процентных пункта называется consistency gap (разрыв в согласованности).

Метрика Pass^5 vs Mean@5

Ключевое отличие заключается в том, что стандартный Pass@k спрашивает, удалось ли решить задачу хотя бы один раз из k попыток. Новый подход Pass^k требует успеха во всех k попытках. Разница между этими метриками обнажает проблему «плоских» распределений вероятностей, где модель находится на грани выбора между равновероятными действиями.

Метрика Значение (GPT-4.1, AppWorld) Суть измерения
Mean@5 77,4% Средняя доля успешных задач (стандартный бенчмарк)
Pass^5 53,0% Доля задач, решенных успешно во всех 5 запусках
Consistency Gap 24,4 п.п. Разница, показывающая уровень нестабильности агента

Решение: ALTK-Evolve и Consistency Analyzer

IBM представила расширение системы ALTK-Evolve, которое автоматически генерирует «правила согласованности» (consistency guidelines). Процесс состоит из двух этапов:

  1. Диагностика (Consistency Analyzer): Система анализирует один записанный траекторию выполнения задачи. Для каждого шага принятия решения делается отдельный вызов модели с параметром k=5 (по умолчанию), чтобы проверить, как часто модель выбирает разные токены при одинаковых условиях. Это позволяет найти «хрупкие» места, где решение зависело от случайности.
  2. Генерация правил: На основе найденных нестабильных точек создаются текстовые инструкции. Например, вместо простого подсчета символов в заметке, агенту предписывается использовать регулярные выражения, привязанные к строкам, чтобы избежать ошибок из-за повторяющихся маркеров в легенде.

Результаты: Сокращение разрыва вдвое

Применение этих правил позволило сократить разрыв в согласованности с 24,4 до 12,0 процентных пунктов. При этом средняя точность (Mean@5) не пострадала. Это означает, что агент стал предсказуемым, не став при этом менее способным в среднем.

Показатель До внедрения После внедрения Consistency Guidelines
Consistency Gap 24,4 п.п. 12,0 п.п.
Pass^5 (Same-task) 53,0% +16,0 п.п. (около 69%)
Pass^5 (Similar-task) +13,0 п.п.
Средняя точность (Mean@5) 77,4% Без изменений

Полная методология и технические детали описаны в отчете на arXiv. Решение позволяет перевести LLM-агентов из категории «интересных демо» в категорию «надежных инструментов» для критически важных задач, таких как финансовый аудит или проверка контрактов.

Источник: Hugging Face blog ↗