Исследования3 июля 2026 г., 15:19 МСК🤖 Auto

AI-агент: 16,9% → 92,8%. Почему умнее модель не спасла

Один и тот же запрос к фронтенд-агенту дал результаты от 16,9% до 92,8%. Оказалось, проблема не в модели, а в отсутствии контекста и валидации.

Баннер новости 2850

Эксперимент: три запуска, три результата

Автор статьи провел простой, но показательный тест: отправил одному и тому же передовому AI-агенту (frontier agent) идентичный запрос три раза. Ожидаемый результат — стабильность. Полученный — хаос. Агент вернул 266 последовательностей, которые он должен был вернуть, но в разных итерациях качество ответа колебалось от 16,9% до 92,8%.

Это не баг генерации случайных чисел. Это системная проблема современных LLM-агентов, которые часто путают «уверенность» с «точностью».

Почему «умная модель» не помогла

Ключевой вывод статьи: улучшение метрик не произошло за счет замены на более мощную или «умную» модель. Проблема лежала в плоскости промпт-инжиниринга и валидации. Агент работал в режиме «черного ящика», не получая четких инструкций по фильтрации шума и проверке результатов.

Детали провала и успеха

Разброс в 76 процентных пунктов между худшим и лучшим результатом указывает на то, что агент не имеет внутреннего механизма саморефлексии для сложных задач без внешнего контроля. В лучшем случае он случайно попадал в нужную логику, в худшем — генерировал галлюцинации.

Метрика Значение Комментарий
Минимальный результат 16,9% Критический провал, агент не справился с задачей
Максимальный результат 92,8% Высокая эффективность при правильной настройке
Разброс (Variance) 75,9% Недопустимо высокая нестабильность для продакшена
Ключевой фактор успеха Не модель Решение лежало в области валидации и контекста

Что это значит для индустрии

Этот кейс бьет по мифу о том, что покупка более дорогой модели автоматически решает проблемы надежности. Для построения стабильных AI-агентов критически важны:

  • Четкие границы задачи: Агент должен точно знать, что считать «успехом».
  • Внешняя валидация: Результаты должны проверяться не самим агентом, а отдельным модулем или правилами.
  • Контекстная полнота: Отсутствие деталей в промпте приводит к догадкам, которые и дают 16,9% вместо 92,8%.

Стабильность AI-агента — это не функция параметров модели, а функция архитектуры взаимодействия.

Источник: Towards AI pub ↗