Проблема монолитных LLM в медицине
Большие языковые модели (LLM), такие как Gemini 2.5 Flash и GPT-5.4 mini, демонстрируют потенциал в интерпретации медицинских изображений, но страдают от критических недостатков: галлюцинаций, низкой точности и стохастической нестабильности. В исследовании на публичных наборах данных ORIGA и RIM-ONE-v3 (по 100 изображений) автономные LLM показали катастрофические результаты. Например, GPT-5.4 mini имел чувствительность 95–100%, но специфичность 0–5%, что означает массовые ложноположительные срабатывания. Gemini 2.5 Flash выдавал разные результаты при каждом запуске (коэффициент Каппы κ ≈ -0.01), что делает его непригодным для клинической практики.
Агентная архитектура: три этапа работы
Авторы разработали фреймворк, объединяющий LLM со специализированными инструментами глубокого обучения. Рабочий процесс состоит из трех шагов:
- Начальная оценка: LLM формирует первичное впечатление.
- Вызов функций (Function Calling): LLM инициирует работу специализированных моделей для оценки качества изображения (QAModel, FundaQ-8), классификации глаукомы (SwinV2-Tiny) и сегментации диска/чашечки (SegFormer-B0).
- Рефлексия: LLM интегрирует исходное впечатление с объективными данными от инструментов.
Результаты: от хаоса к точности
Интеграция специализированных инструментов кардинально изменила метрики. Точность классификации выросла на 16–47 процентных пунктов. На наборе RIM-ONE-v3 лучшие конфигурации достигли точности 88%, что сопоставимо с уровнем специалиста. Ошибка измерения соотношения «чашечка-диск» (MAE) снизилась с 0.156–0.228 до 0.104–0.132, а корреляция с оценкой врача выросла с weak (r=0.12–0.39) до moderate-strong (r=0.59–0.84).
| Метрика | LLM Alone (GPT-5.4 mini) | LLM Alone (Gemini 2.5 Flash) | Agentic Framework |
|---|---|---|---|
| Специфичность | 0–5% | Не указано (высокая вариабельность) | Значительный рост (в пределах 6 п.п. от врача) |
| MAE (соотношение чашечка-диск) | 0.156–0.228 | 0.156–0.228 | 0.104–0.132 |
| Корреляция с врачом (r) | 0.12–0.39 | 0.12–0.39 | 0.59–0.84 |
| Стабильность (Cohen's Kappa) | ~0.00 | ~0.00 | до 0.96 |
Значение для отрасли
Результаты подтверждают гипотезу о сдвиге парадигмы: от использования монолитных LLM к оркестрированным многоагентным системам. Агентный подход не только исправляет ошибки конкретных моделей, но и обеспечивает обобщаемость результатов, так как улучшения наблюдались для обоих протестированных бэкбондов. Это открывает путь к созданию надежных диагностических инструментов, способных конкурировать с экспертами-офтальмологами.
Источник: arXiv cs.AI ↗
