Стандартные бенчмарки скрывают главную проблему внедрения AI-агентов в продакшен: нестабильность. Модель может показывать 77.4% успеха в среднем, но проваливать задачу при повторном запуске. IBM Research решает эту проблему через систему ALTK-Evolve и новый инструмент Consistency Analyzer, который превращает прошлые траектории агента в стабильные инструкции.
01Проблема: Consistency Gap
В индустрии принято оценивать агентов через метрику Mean@k (средний процент успешных запусков). Однако для критических задач (финансы, контракты) важнее метрика Pass^k — доля задач, решенных успешно во всех k попытках.
На датасете AppWorld с моделью GPT-4.1 (ReAct-агент) наблюдаются следующие цифры:
- Mean@5: 77.4% (агент в среднем хорош).
- Pass^5: 53.0% (в половине случаев агент «флипает» решение).
- Consistency Gap: 24.4 процентных пункта.
Эта разница возникает из-за «плоских» распределений вероятностей токенов. Когда модель сомневается между двумя вариантами действий, малейшие изменения в окружении (батчинг запросов, плавающая точка GPU) меняют итоговое решение. Greedy decoding (temperature=0) не помогает, так как проблема не в семплинге, а в неопределенности самой модели.
02Решение: Consistency Guidelines
Метод ALTK-Evolve извлекает из истории работы агента специфические правила, устраняющие точки неопределенности. Процесс состоит из двух этапов:
1. Диагностика (Consistency Analyzer)
Инструмент анализирует один записанный траекторию выполнения задачи. Для каждого шага принятия решения делается один вызов модели с параметром num_completions=k (по умолчанию k=5). Это позволяет выявить шаги, где модель дает разные ответы при одинаковом контексте, не требуя ground-truth или доступа к логитам.
2. Генерация правил
На основе выявленных «слабых мест» генерируются текстовые инструкции (guidelines), которые подставляются в контекст при инференсе. Эти правила носят общий характер, а не привязаны к конкретной задаче.
Пример сгенерированного правила для задачи подсчета чекбоксов:
[Guideline 1] When counting checkbox-style markers in note content, use a line-anchored regex match rather than a plain substring count — note titles often repeat the marker symbol in a legend line.03Результаты оптимизации
Внедрение Consistency Guidelines позволило сократить разрыв в стабильности почти вдвое, не снизив общую точность.
| Метрика | Без Guidelines | С Guidelines | Изменение |
|---|---|---|---|
| Mean@5 (Средняя точность) | 77.4% | 81.0% | +3.6pp |
| Pass^5 (Стабильность) | 53.0% | 69.0% | +16.0pp |
| Consistency Gap | 24.4pp | 12.0pp | -12.4pp (сокращение на ~50%) |
Наибольший прирост стабильности наблюдается на сложных задачах: +14.3pp для Hard-уровня и +22.9pp для Medium. Это подтверждает, что метод эффективен именно там, где неопределенность модели максимальна.
04Техническая реализация
Для воспроизведения диагностики используется параметр num_completions в API-вызовах. Это позволяет оценить дисперсию решений за один проход, избегая дорогостоящих многократных запусков задачи.
# Пример логики анализа (псевдокод)
def analyze_consistency(trace, model, k=5):
scores = []
for step in trace.decisions:
# Запрос k вариантов ответа для одного шага
completions = model.generate(step.context, num_completions=k)
# Оценка согласованности ответов
consistency_score = calculate_variance(completions)
scores.append(consistency_score)
return scores05Кому подойдёт / что запустится
Метод ALTK-Evolve с Consistency Guidelines подходит для:
- Enterprise-агентов: где цена ошибки высока, а повторный запуск недопустим.
- Сложных сценариев (ReAct): особенно в задачах с внешними API и обработкой неструктурированных данных (заметки, документы).
- Оптимизации затрат: повышение Pass^5 позволяет реже перезапускать задачи, экономя токены и время.
Решение совместимо с любыми LLM, поддерживающими параметр множественного вывода (num_completions), включая GPT-4.1 и локальные модели через vLLM/Ollama. Требует наличия истории траекторий для анализа.
Источник: Hugging Face ↗
