Суть проблемы: «рецепты» против реального инжиниринга
AI-агенты всё чаще используются для автоматизации R&D, но существующие бенчмарки часто оценивают их по узким сценариям или предписанным рабочим процессам. Авторы исследования из arXiv (2026) отмечают, что даже в «открытых» задачах агенты часто просто извлекают известные рецепты и подкручивают гиперпараметры. Это создаёт иллюзию оптимизации, скрывая отсутствие глубокого понимания архитектуры. Чтобы проверить, способны ли агенты к настоящему инжинирингу, команда представила InferenceBench.
Условия эксперимента: 15 агентов, 1 GPU, 2 часа
Каждый агент получает:
- Целевую LLM-модель.
- Один GPU NVIDIA H100.
- Сценарий оптимизации (латентность префилла, декодирования, пропускная способность или баланс).
- Бюджет времени: 2 часа реального времени (wall-clock time).
Задача — развернуть OpenAI-compatible inference server и максимизировать скорость инференса. Всего протестировано 15 конфигураций фронтенд-агентов.
Результаты: агенты проигрывают «грубой силе»
Агенты действительно улучшают результаты по сравнению с наивным PyTorch-бейзлайном, но их эффективность ограничена. Они не могут превзойти простой перебор гиперпараметров (grid search), который за то же время показывает лучшие метрики. Ключевая проблема — агенты тратят бюджет на повторные замеры и исправление ошибок, а не на исследование новых стратегий.
| Метрика / Сценарий | Результат агентов (относительно PyTorch) | Сравнение с vLLM (default) | Результат Grid Search |
|---|---|---|---|
| Максимальное улучшение | до 8.08x | до 4.05x (лучше vLLM) | до 11.53x |
| Типичное поведение | Конвергенция на одном фреймворке, тестирование 1-2 конфигураций, остальное время — отладка. | ||
Почему это важно для индустрии
Исследование выявляет фундаментальный недостаток текущих AI-агентов: неспособность предлагать диверсифицированные конфигурации. Вместо того чтобы исследовать разные подходы (например, кастомные ядра, другие движки сервинга, оптимизации памяти), агенты выбирают один путь (чаще всего vLLM или аналогичный) и бесконечно его тонко настраивают. Это означает, что для сложных задач оптимизации инфраструктуры пока требуется человеческий контроль или гибридные подходы, где агент не заменяет, а лишь ассистирует инженеру.
Источник: arXiv cs.AI ↗
