Проблема «одного промпта» и решение агентов
Флагманские большие языковые модели (LLM) часто демонстрируют хрупкое диагностическое мышление при использовании в режиме single-shot prompting. Медицинская диагностика — это многоэтапный процесс, требующий извлечения фактов, консультации с базой знаний, генерации дифференциального анализа и выбора лучшего диагноза с объяснениями. Команда John Snow Labs разработала DeepLens Diagnosis Agent — пятиступенчатый пайплайн, который комбинирует возможности небольшой модели с дисциплинированными процессными ограничениями.
Архитектура и метрики эффективности
В основе системы лежит модель JSL Medical Small 7B v2 с дообученным RAG (Retrieval-Augmented Generation). Пайплайн принудительно структурирует клиническое извлечение, ограничивает генерацию кандидатов и требует явной триангуляции доказательств. На бенчмарке DiagnosisArena (915 случаев) агент достиг точности 60.14% в режиме top-1. Для сравнения: та же модель без агентного рабочего процесса показала лишь 23.99%, что дает прирост в +36 пунктов исключительно за счет дизайна workflow.
| Модель / Система | Точность (Top-1) | Стоимость за случай | Задержка (Latency) |
|---|---|---|---|
| DeepLens Agent (JSL Small 7B v2) | 60.14% | $0.0072 | 24 сек |
| Claude Sonnet 4.5 | 50.44% | $0.0110 | — |
| Gemini 3.1 Pro | 50.97% | $0.0128 | — |
| JSL Small 7B v2 (без агента) | 23.99% | — | — |
Экономическая эффективность и прозрачность
DeepLens не только превосходит флагманы по точности (+9.70pp против Claude Sonnet 4.5 и +9.17pp против Gemini 3.1 Pro), но и значительно дешевле. Стоимость одного случая составляет $0.0072 (при использовании 24K токенов на GPU A100), что на 35-45% дешевле решений от Anthropic и Google. Кроме того, пайплайн генерирует структурированные промежуточные артефакты, что позволяет аудировать каждое решение — критически важное требование для высокорисковых медицинских сценариев.
Вывод: процесс важнее параметров
Исследование доказывает, что в условиях неопределенности диагностическое мышление требует не просто объема знаний, а строгой структуры. Ограничения рабочего процесса (workflow constraints) могут перевесить преимущество в количестве параметров или стоимости API. DeepLens также способен исправлять ошибки флагманских моделей, что открывает путь к гибридным системам, где малые специализированные агенты управляют или дополняют крупные универсальные LLM.
Источник: arXiv cs.AI ↗
