Исследования28 июля 2026 г., 09:16 МСК🤖 Auto

DeepLens: как малая модель обогнала Claude и Gemini в диагностике

Исследователи из John Snow Labs представили агентный пайплайн DeepLens, который позволил модели JSL Medical Small 7B v2 превзойти флагманские LLM в медицинской диагностике, снизив стоимость запроса в 1.5 раза.

Баннер новости 4518

Проблема «одного промпта» и решение агентов

Флагманские большие языковые модели (LLM) часто демонстрируют хрупкое диагностическое мышление при использовании в режиме single-shot prompting. Медицинская диагностика — это многоэтапный процесс, требующий извлечения фактов, консультации с базой знаний, генерации дифференциального анализа и выбора лучшего диагноза с объяснениями. Команда John Snow Labs разработала DeepLens Diagnosis Agent — пятиступенчатый пайплайн, который комбинирует возможности небольшой модели с дисциплинированными процессными ограничениями.

Архитектура и метрики эффективности

В основе системы лежит модель JSL Medical Small 7B v2 с дообученным RAG (Retrieval-Augmented Generation). Пайплайн принудительно структурирует клиническое извлечение, ограничивает генерацию кандидатов и требует явной триангуляции доказательств. На бенчмарке DiagnosisArena (915 случаев) агент достиг точности 60.14% в режиме top-1. Для сравнения: та же модель без агентного рабочего процесса показала лишь 23.99%, что дает прирост в +36 пунктов исключительно за счет дизайна workflow.

Модель / Система Точность (Top-1) Стоимость за случай Задержка (Latency)
DeepLens Agent (JSL Small 7B v2) 60.14% $0.0072 24 сек
Claude Sonnet 4.5 50.44% $0.0110
Gemini 3.1 Pro 50.97% $0.0128
JSL Small 7B v2 (без агента) 23.99%

Экономическая эффективность и прозрачность

DeepLens не только превосходит флагманы по точности (+9.70pp против Claude Sonnet 4.5 и +9.17pp против Gemini 3.1 Pro), но и значительно дешевле. Стоимость одного случая составляет $0.0072 (при использовании 24K токенов на GPU A100), что на 35-45% дешевле решений от Anthropic и Google. Кроме того, пайплайн генерирует структурированные промежуточные артефакты, что позволяет аудировать каждое решение — критически важное требование для высокорисковых медицинских сценариев.

Вывод: процесс важнее параметров

Исследование доказывает, что в условиях неопределенности диагностическое мышление требует не просто объема знаний, а строгой структуры. Ограничения рабочего процесса (workflow constraints) могут перевесить преимущество в количестве параметров или стоимости API. DeepLens также способен исправлять ошибки флагманских моделей, что открывает путь к гибридным системам, где малые специализированные агенты управляют или дополняют крупные универсальные LLM.

Источник: arXiv cs.AI ↗