Исследования24 июля 2026 г., 09:16 МСК🤖 Auto

InferenceBench: AI-агенты уступают простому перебору гиперпараметров

Новый бенчмарк InferenceBench показал, что AI-агенты не справляются с оптимизацией LLM-инференса лучше, чем простой поиск по сетке, упорно зацикливаясь на одном фреймворке.

Баннер новости 4271

Суть проблемы: «рецепты» против реального инжиниринга

AI-агенты всё чаще используются для автоматизации R&D, но существующие бенчмарки часто оценивают их по узким сценариям или предписанным рабочим процессам. Авторы исследования из arXiv (2026) отмечают, что даже в «открытых» задачах агенты часто просто извлекают известные рецепты и подкручивают гиперпараметры. Это создаёт иллюзию оптимизации, скрывая отсутствие глубокого понимания архитектуры. Чтобы проверить, способны ли агенты к настоящему инжинирингу, команда представила InferenceBench.

Условия эксперимента: 15 агентов, 1 GPU, 2 часа

Каждый агент получает:

  • Целевую LLM-модель.
  • Один GPU NVIDIA H100.
  • Сценарий оптимизации (латентность префилла, декодирования, пропускная способность или баланс).
  • Бюджет времени: 2 часа реального времени (wall-clock time).

Задача — развернуть OpenAI-compatible inference server и максимизировать скорость инференса. Всего протестировано 15 конфигураций фронтенд-агентов.

Результаты: агенты проигрывают «грубой силе»

Агенты действительно улучшают результаты по сравнению с наивным PyTorch-бейзлайном, но их эффективность ограничена. Они не могут превзойти простой перебор гиперпараметров (grid search), который за то же время показывает лучшие метрики. Ключевая проблема — агенты тратят бюджет на повторные замеры и исправление ошибок, а не на исследование новых стратегий.

Метрика / Сценарий Результат агентов (относительно PyTorch) Сравнение с vLLM (default) Результат Grid Search
Максимальное улучшение до 8.08x до 4.05x (лучше vLLM) до 11.53x
Типичное поведение Конвергенция на одном фреймворке, тестирование 1-2 конфигураций, остальное время — отладка.

Почему это важно для индустрии

Исследование выявляет фундаментальный недостаток текущих AI-агентов: неспособность предлагать диверсифицированные конфигурации. Вместо того чтобы исследовать разные подходы (например, кастомные ядра, другие движки сервинга, оптимизации памяти), агенты выбирают один путь (чаще всего vLLM или аналогичный) и бесконечно его тонко настраивают. Это означает, что для сложных задач оптимизации инфраструктуры пока требуется человеческий контроль или гибридные подходы, где агент не заменяет, а лишь ассистирует инженеру.

Источник: arXiv cs.AI ↗