Исследования12 августа 2026 г., 02:18 МСК🤖 Auto

Agentic AI против LLM: прорыв в диагностике глаукомы

Исследователи представили агентную архитектуру, устраняющую галлюцинации и нестабильность больших языковых моделей при анализе снимков глазного дна.

Баннер новости 5567

Проблема монолитных LLM в медицине

Большие языковые модели (LLM), такие как Gemini 2.5 Flash и GPT-5.4 mini, демонстрируют потенциал в интерпретации медицинских изображений, но страдают от критических недостатков: галлюцинаций, низкой точности и стохастической нестабильности. В исследовании на публичных наборах данных ORIGA и RIM-ONE-v3 (по 100 изображений) автономные LLM показали катастрофические результаты. Например, GPT-5.4 mini имел чувствительность 95–100%, но специфичность 0–5%, что означает массовые ложноположительные срабатывания. Gemini 2.5 Flash выдавал разные результаты при каждом запуске (коэффициент Каппы κ ≈ -0.01), что делает его непригодным для клинической практики.

Агентная архитектура: три этапа работы

Авторы разработали фреймворк, объединяющий LLM со специализированными инструментами глубокого обучения. Рабочий процесс состоит из трех шагов:

  • Начальная оценка: LLM формирует первичное впечатление.
  • Вызов функций (Function Calling): LLM инициирует работу специализированных моделей для оценки качества изображения (QAModel, FundaQ-8), классификации глаукомы (SwinV2-Tiny) и сегментации диска/чашечки (SegFormer-B0).
  • Рефлексия: LLM интегрирует исходное впечатление с объективными данными от инструментов.

Результаты: от хаоса к точности

Интеграция специализированных инструментов кардинально изменила метрики. Точность классификации выросла на 16–47 процентных пунктов. На наборе RIM-ONE-v3 лучшие конфигурации достигли точности 88%, что сопоставимо с уровнем специалиста. Ошибка измерения соотношения «чашечка-диск» (MAE) снизилась с 0.156–0.228 до 0.104–0.132, а корреляция с оценкой врача выросла с weak (r=0.12–0.39) до moderate-strong (r=0.59–0.84).

Метрика LLM Alone (GPT-5.4 mini) LLM Alone (Gemini 2.5 Flash) Agentic Framework
Специфичность 0–5% Не указано (высокая вариабельность) Значительный рост (в пределах 6 п.п. от врача)
MAE (соотношение чашечка-диск) 0.156–0.228 0.156–0.228 0.104–0.132
Корреляция с врачом (r) 0.12–0.39 0.12–0.39 0.59–0.84
Стабильность (Cohen's Kappa) ~0.00 ~0.00 до 0.96

Значение для отрасли

Результаты подтверждают гипотезу о сдвиге парадигмы: от использования монолитных LLM к оркестрированным многоагентным системам. Агентный подход не только исправляет ошибки конкретных моделей, но и обеспечивает обобщаемость результатов, так как улучшения наблюдались для обоих протестированных бэкбондов. Это открывает путь к созданию надежных диагностических инструментов, способных конкурировать с экспертами-офтальмологами.

Источник: arXiv cs.AI ↗