Исследования7 августа 2026 г., 15:17 МСК🤖 Auto

Агенты ИИ в микроскопии: бенчмарки не предсказывают успех на новых задачах

Исследование Johnson и Abshire (2026) показало, что оптимизация LLM-агентов для микроскопии работает только в рамках тестов. На новых задачах модели дают сбой, а метрики качества не коррелируют с реальной эффективностью.

Баннер новости 5303

Масштаб эксперимента: 105 конфигураций и 49 000 запросов

Команда исследователей разработала фреймворк для оценки агентов на базе больших языковых моделей (LLM), управляющих микроскопами. Цель — найти оптимальную архитектуру для автономной работы с научным оборудованием. В ходе валидации были протестированы:

  • 5 различных LLM;
  • 3 топологии агентов (одиночный, двухагентная и трехагентная графовая структура);
  • Параметры RAG (Retrieval-Augmented Generation) и контекстные окна;
  • 53 теста в рамках бенчмарка микроскопии.

Итого зафиксировано 1 949 индивидуальных запусков и 49 109 запросов к базе знаний (RAG retrievals). Это позволило собрать детальную статистику по задержкам, использованию токенов, стоимости и типичным ошибкам.

Ключевые метрики производительности

Прямое сравнение конфигураций выявило существенные различия в ресурсоемкости и надежности. Ниже приведена сводка по основным параметрам, которые варьировались в зависимости от архитектуры агента:

Параметр Влияние архитектуры Значение для исследователя
Задержка (Latency) Многоагентные системы (2-3 агента) демонстрируют более высокую задержку из-за необходимости координации и делегирования задач. Критично для задач, требующих быстрого отклика в реальном времени.
Использование токенов Количество токенов сильно зависит от параметров RAG и размера контекста. Сложные топологии генерируют больше служебных токенов. Прямое влияние на стоимость эксплуатации агента.
Режимы сбоев (Failure Modes) Разные модели LLM и топологии имеют уникальные паттерны ошибок (например, зацикливание или неверная интерпретация изображений). Позволяет диагностировать слабые места конкретной конфигурации.

Главный вывод: бенчмарки не обобщаются

Самое важное открытие исследования заключается в том, что существующие бенчмарки не позволяют предсказать успех агента на новых, незнакомых задачах. Исследователи пытались обучить суррогатные модели (proxy models) на основе архитектуры агента и результатов тестов, чтобы прогнозировать производительность на неизвестных данных. Эти попытки провалились: корреляция оказалась низкой.

Авторы объясняют это гетерогенностью тестового набора. То, что делает агента эффективным в рамках известного сценария (например, поиск конкретной клетки), не гарантирует, что он справится с совершенно иной задачей (например, настройка фокуса на новом образце). Текущие тестовые наборы подходят только для:

  • Квалификации (проверки базовых функций);
  • Регрессионного тестирования;
  • Диагностики конкретных сбоев;
  • Прямого сравнения конфигураций в идентичных условиях.

Почему это важно для AI-индустрии

Результаты работы Johnson и Abshire служат предупреждением для разработчиков автономных научных систем. Нельзя полагаться исключительно на метрики качества в рамках фиксированного набора задач. Для создания по-настоящему универсальных агентов, управляющих физическим оборудованием (микроскопами, синхротронами), необходимы новые парадигмы оценки, учитывающие способность к обобщению, а не просто оптимизация под конкретный бенчмарк.

Источник: arXiv cs.AI ↗