Масштаб эксперимента: 105 конфигураций и 49 000 запросов
Команда исследователей разработала фреймворк для оценки агентов на базе больших языковых моделей (LLM), управляющих микроскопами. Цель — найти оптимальную архитектуру для автономной работы с научным оборудованием. В ходе валидации были протестированы:
- 5 различных LLM;
- 3 топологии агентов (одиночный, двухагентная и трехагентная графовая структура);
- Параметры RAG (Retrieval-Augmented Generation) и контекстные окна;
- 53 теста в рамках бенчмарка микроскопии.
Итого зафиксировано 1 949 индивидуальных запусков и 49 109 запросов к базе знаний (RAG retrievals). Это позволило собрать детальную статистику по задержкам, использованию токенов, стоимости и типичным ошибкам.
Ключевые метрики производительности
Прямое сравнение конфигураций выявило существенные различия в ресурсоемкости и надежности. Ниже приведена сводка по основным параметрам, которые варьировались в зависимости от архитектуры агента:
| Параметр | Влияние архитектуры | Значение для исследователя |
|---|---|---|
| Задержка (Latency) | Многоагентные системы (2-3 агента) демонстрируют более высокую задержку из-за необходимости координации и делегирования задач. | Критично для задач, требующих быстрого отклика в реальном времени. |
| Использование токенов | Количество токенов сильно зависит от параметров RAG и размера контекста. Сложные топологии генерируют больше служебных токенов. | Прямое влияние на стоимость эксплуатации агента. |
| Режимы сбоев (Failure Modes) | Разные модели LLM и топологии имеют уникальные паттерны ошибок (например, зацикливание или неверная интерпретация изображений). | Позволяет диагностировать слабые места конкретной конфигурации. |
Главный вывод: бенчмарки не обобщаются
Самое важное открытие исследования заключается в том, что существующие бенчмарки не позволяют предсказать успех агента на новых, незнакомых задачах. Исследователи пытались обучить суррогатные модели (proxy models) на основе архитектуры агента и результатов тестов, чтобы прогнозировать производительность на неизвестных данных. Эти попытки провалились: корреляция оказалась низкой.
Авторы объясняют это гетерогенностью тестового набора. То, что делает агента эффективным в рамках известного сценария (например, поиск конкретной клетки), не гарантирует, что он справится с совершенно иной задачей (например, настройка фокуса на новом образце). Текущие тестовые наборы подходят только для:
- Квалификации (проверки базовых функций);
- Регрессионного тестирования;
- Диагностики конкретных сбоев;
- Прямого сравнения конфигураций в идентичных условиях.
Почему это важно для AI-индустрии
Результаты работы Johnson и Abshire служат предупреждением для разработчиков автономных научных систем. Нельзя полагаться исключительно на метрики качества в рамках фиксированного набора задач. Для создания по-настоящему универсальных агентов, управляющих физическим оборудованием (микроскопами, синхротронами), необходимы новые парадигмы оценки, учитывающие способность к обобщению, а не просто оптимизация под конкретный бенчмарк.
Источник: arXiv cs.AI ↗
