Главная/Блог/Аналитика/ALTK-Evolve: Как устранить…
Аналитика3 мин чтения · 15 сентября 2026 г.

ALTK-Evolve: Как устранить нестабильность AI-агентов

IBM Research представила метод Consistency Guidelines для ALTK-Evolve, сокращающий разрыв между средней точностью и стабильностью агентов на 50% без потери производительности.

ALTK-Evolve: Как устранить нестабильность AI-агентов

Стандартные бенчмарки скрывают главную проблему внедрения AI-агентов в продакшен: нестабильность. Модель может показывать 77.4% успеха в среднем, но проваливать задачу при повторном запуске. IBM Research решает эту проблему через систему ALTK-Evolve и новый инструмент Consistency Analyzer, который превращает прошлые траектории агента в стабильные инструкции.

01Проблема: Consistency Gap

В индустрии принято оценивать агентов через метрику Mean@k (средний процент успешных запусков). Однако для критических задач (финансы, контракты) важнее метрика Pass^k — доля задач, решенных успешно во всех k попытках.

На датасете AppWorld с моделью GPT-4.1 (ReAct-агент) наблюдаются следующие цифры:

  • Mean@5: 77.4% (агент в среднем хорош).
  • Pass^5: 53.0% (в половине случаев агент «флипает» решение).
  • Consistency Gap: 24.4 процентных пункта.

Эта разница возникает из-за «плоских» распределений вероятностей токенов. Когда модель сомневается между двумя вариантами действий, малейшие изменения в окружении (батчинг запросов, плавающая точка GPU) меняют итоговое решение. Greedy decoding (temperature=0) не помогает, так как проблема не в семплинге, а в неопределенности самой модели.

⚠️
Важно для практиков. Не путайте Pass@k (успех хотя бы в одной из k попыток) и Pass^k (успех во всех k попытках). Для надежности бизнеса критичен именно Pass^k.

02Решение: Consistency Guidelines

Метод ALTK-Evolve извлекает из истории работы агента специфические правила, устраняющие точки неопределенности. Процесс состоит из двух этапов:

1. Диагностика (Consistency Analyzer)

Инструмент анализирует один записанный траекторию выполнения задачи. Для каждого шага принятия решения делается один вызов модели с параметром num_completions=k (по умолчанию k=5). Это позволяет выявить шаги, где модель дает разные ответы при одинаковом контексте, не требуя ground-truth или доступа к логитам.

2. Генерация правил

На основе выявленных «слабых мест» генерируются текстовые инструкции (guidelines), которые подставляются в контекст при инференсе. Эти правила носят общий характер, а не привязаны к конкретной задаче.

Пример сгенерированного правила для задачи подсчета чекбоксов:

terminaltext
[Guideline 1] When counting checkbox-style markers in note content, use a line-anchored regex match rather than a plain substring count — note titles often repeat the marker symbol in a legend line.

03Результаты оптимизации

Внедрение Consistency Guidelines позволило сократить разрыв в стабильности почти вдвое, не снизив общую точность.

Метрика Без Guidelines С Guidelines Изменение
Mean@5 (Средняя точность) 77.4% 81.0% +3.6pp
Pass^5 (Стабильность) 53.0% 69.0% +16.0pp
Consistency Gap 24.4pp 12.0pp -12.4pp (сокращение на ~50%)

Наибольший прирост стабильности наблюдается на сложных задачах: +14.3pp для Hard-уровня и +22.9pp для Medium. Это подтверждает, что метод эффективен именно там, где неопределенность модели максимальна.

💡
Практический совет. ALTK-Evolve работает как black-box: вам не нужно переобучать модель или менять архитектуру. Достаточно собрать траектории, запустить анализатор и добавить сгенерированные правила в system prompt.

04Техническая реализация

Для воспроизведения диагностики используется параметр num_completions в API-вызовах. Это позволяет оценить дисперсию решений за один проход, избегая дорогостоящих многократных запусков задачи.

terminalpython
# Пример логики анализа (псевдокод)
def analyze_consistency(trace, model, k=5):
    scores = []
    for step in trace.decisions:
        # Запрос k вариантов ответа для одного шага
        completions = model.generate(step.context, num_completions=k)
        # Оценка согласованности ответов
        consistency_score = calculate_variance(completions)
        scores.append(consistency_score)
    return scores

05Кому подойдёт / что запустится

Метод ALTK-Evolve с Consistency Guidelines подходит для:

  • Enterprise-агентов: где цена ошибки высока, а повторный запуск недопустим.
  • Сложных сценариев (ReAct): особенно в задачах с внешними API и обработкой неструктурированных данных (заметки, документы).
  • Оптимизации затрат: повышение Pass^5 позволяет реже перезапускать задачи, экономя токены и время.

Решение совместимо с любыми LLM, поддерживающими параметр множественного вывода (num_completions), включая GPT-4.1 и локальные модели через vLLM/Ollama. Требует наличия истории траекторий для анализа.

Источник: Hugging Face ↗