Исследования22 сентября 2026 г., 07:20 МСК🤖 Auto

Как сократить тесты LLM-агентов на 60% без потери точности

Исследование Yining She и Lei Lin показывает, как эффективно оценивать LLM-агентов в продакшене: адаптивное тестирование снижает нагрузку на 38,5%, а фиксированные наборы вопросов работают стабильно.

Баннер новости 8009

Проблема: стоимость полного бенчмарка

Оценка LLM-агентов в реальных условиях (production) — это не разовое действие, а непрерывный процесс. По мере эволюции модели агента его необходимо регулярно тестировать, чтобы контролировать качество. Однако полный запуск бенчмарка для агентов, обслуживающих десятки тысяч пользователей, требует огромных вычислительных ресурсов и времени. Авторы исследования, опубликованного в arXiv (2609.21267), проанализировали 574 исторических запуска продакшен-аналитического агента, чтобы найти баланс между точностью оценки и эффективностью.

Методология: сравнение подходов

Исследователи разделили данные на калибровочный и тестовый периоды, чтобы сравнить четыре стратегии повторной оценки:

  • Случайная выборка (Random Sampling): базовый метод случайного отбора вопросов.
  • Историческое кэширование (Historical Caching): повторное использование результатов прошлых запусков.
  • Фиксированные репрезентативные подмножества (Fixed Representative Subsets): статичный набор вопросов, отобранный заранее.
  • Адаптивное тестирование на основе IRT (Item Response Theory): динамический подбор вопросов на основе сложности и ответов пользователя.

Результаты: точность против эффективности

Наилучшие результаты по сохранению верности оценки (score fidelity) показало многомерное адаптивное тестирование с двумя параметрами (2PL IRT). Этот метод позволяет существенно сократить объем тестирования, сохраняя при этом высокую точность метрик.

Метод оценки Объем вопросов Доля от полного запуска MAE (Средняя абсолютная ошибка)
Полный запуск (Baseline) ~520+ 100% 0.00 pp
Адаптивное тестирование (2PL IRT) 200 38,5% 1,03 pp

Как видно из таблицы, использование всего 200 вопросов вместо полного набора снижает нагрузку на систему почти в 2,6 раза, при этом средняя абсолютная ошибка (MAE) составляет всего 1,03 процентных пункта. Это означает, что оценка качества агента остается практически неотличимой от полной проверки.

Практическое решение: фиксированные наборы

Несмотря на превосходство адаптивного тестирования в метриках, исследователи выбрали для деплоя стратифицированные фиксированные подмножества. Причина — операционная простота. Фиксированный набор вопросов не требует сложной логики адаптации в реальном времени.

Ключевое открытие: эти фиксированные наборы оказались универсальными. Они успешно перенеслись (transfer) на пять других семейств агентов без необходимости повторной калибровки. Кроме того, набор остается стабильным даже при использовании калибровочных окон всего в один день, что критически важно для быстрых итераций в разработке.

Выводы для индустрии

Исследование демонстрирует, что для продакшен-агентов не обязательно проводить полные регрессионные тесты при каждом обновлении. Использование оптимизированных подмножеств вопросов (как адаптивных, так и фиксированных) позволяет экономить ресурсы, не жертвуя качеством контроля. Это особенно актуально для систем, где агенты обслуживают десятки тысяч активных пользователей ежемесячно, и каждый цикл оценки должен быть быстрым и дешевым.

Источник: arXiv cs.AI ↗