Исследования15 июля 2026 г., 12:17 МСК🤖 Auto

Эволюция агентов: почему автоматическая настройка промптов проигрывает простому масштабированию

Исследование из arXiv показывает, что сложные методы автоматической эволюции «упряжи» (harness) для LLM-агентов часто уступают простым методам тестового масштабирования и плохо обобщаются на новые задачи.

Баннер новости 3618

Проблема нечестных бенчмарков

Авторы работы, опубликованной в arXiv (2607.12227), подвергли критике существующую методологию оценки автоматической эволюции агентов. Традиционный подход использует юнит-тесты для поиска конфигураций, а затем отчитывается о результатах на том же публичном бенчмарке. Это создает два фундаментальных риска:

  • Overfitting (переобучение): Поиск и финальная оценка происходят на одних и тех же данных, что искусственно завышает метрики.
  • Отсутствие корректных базовых линий: Эволюция — это итеративный процесс. Если не сравнивать её с простыми методами поиска при равных бюджетах на инференс и обратную связь, невозможно понять: улучшение дает сложная архитектура или просто большее количество попыток.

Эксперимент: GPT-5.4 и Claude Opus 4.6

Для проверки гипотезы команда провела масштабное тестирование на Terminal-Bench 2.1. В качестве моделей-агентов использовались GPT-5.4 и Claude Opus 4.6. Ключевым условием стало сравнение автоматической эволюции упряжи (harness evolution) с простыми методами тестового масштабирования (test-time scaling) и обнаружения (discovery baselines) при строго выровненных бюджетах на вычисления.

Результаты: эволюция не всегда лучше

Результаты оказались неожиданными для многих исследователей. Автоматическая эволюция не продемонстрировала стабильного превосходства над более простыми методами. Более того, выявлена проблема с обобщением: улучшения, найденные на тренировочных задачах, плохо работают на «скрытых» (held-out) наборах данных.

Метод оценки Сравнение с базовой линией Обобщение (Generalization) Итоговый вывод
Автоматическая эволюция упряжи Не всегда превосходит простое масштабирование Ограниченная способность к переносу на новые задачи Требует пересмотра протоколов оценки
Простое тестовое масштабирование (Test-time scaling) Конкурентоспособно или лучше Более стабильно Эффективная альтернатива сложной эволюции

Почему это важно для индустрии

Работа ставит под сомнение эффективность дорогостоящих пайплайнов автоматического дизайна промптов и структур агентов. Если «умная» настройка не дает прироста качества по сравнению с простым увеличением числа попыток (search budget), инвестирование ресурсов в сложные алгоритмы эволюции может быть неоправданным. Авторы призывают сообщество перейти к более строгим протоколам оценки, где бенчмарки для поиска и финального тестирования строго разделены.

Источник: arXiv cs.AI ↗