Проблема нечестных бенчмарков
Авторы работы, опубликованной в arXiv (2607.12227), подвергли критике существующую методологию оценки автоматической эволюции агентов. Традиционный подход использует юнит-тесты для поиска конфигураций, а затем отчитывается о результатах на том же публичном бенчмарке. Это создает два фундаментальных риска:
- Overfitting (переобучение): Поиск и финальная оценка происходят на одних и тех же данных, что искусственно завышает метрики.
- Отсутствие корректных базовых линий: Эволюция — это итеративный процесс. Если не сравнивать её с простыми методами поиска при равных бюджетах на инференс и обратную связь, невозможно понять: улучшение дает сложная архитектура или просто большее количество попыток.
Эксперимент: GPT-5.4 и Claude Opus 4.6
Для проверки гипотезы команда провела масштабное тестирование на Terminal-Bench 2.1. В качестве моделей-агентов использовались GPT-5.4 и Claude Opus 4.6. Ключевым условием стало сравнение автоматической эволюции упряжи (harness evolution) с простыми методами тестового масштабирования (test-time scaling) и обнаружения (discovery baselines) при строго выровненных бюджетах на вычисления.
Результаты: эволюция не всегда лучше
Результаты оказались неожиданными для многих исследователей. Автоматическая эволюция не продемонстрировала стабильного превосходства над более простыми методами. Более того, выявлена проблема с обобщением: улучшения, найденные на тренировочных задачах, плохо работают на «скрытых» (held-out) наборах данных.
| Метод оценки | Сравнение с базовой линией | Обобщение (Generalization) | Итоговый вывод |
|---|---|---|---|
| Автоматическая эволюция упряжи | Не всегда превосходит простое масштабирование | Ограниченная способность к переносу на новые задачи | Требует пересмотра протоколов оценки |
| Простое тестовое масштабирование (Test-time scaling) | Конкурентоспособно или лучше | Более стабильно | Эффективная альтернатива сложной эволюции |
Почему это важно для индустрии
Работа ставит под сомнение эффективность дорогостоящих пайплайнов автоматического дизайна промптов и структур агентов. Если «умная» настройка не дает прироста качества по сравнению с простым увеличением числа попыток (search budget), инвестирование ресурсов в сложные алгоритмы эволюции может быть неоправданным. Авторы призывают сообщество перейти к более строгим протоколам оценки, где бенчмарки для поиска и финального тестирования строго разделены.
Источник: arXiv cs.AI ↗
