Проблема упрощенных бенчмарков
Существующие тесты для оценки больших языковых моделей (LLM) в медицине часто искусственно упрощены: один пациент — один калькулятор, инструмент явно указан в запросе. В реальной клинической практике врачи сталкиваются с множественными калькуляторами, вложенными вычислениями и нечеткими запросами, где модель должна сама определить нужные инструменты. Это приводит к ошибкам, которые в медицине недопустимы.
Что такое MedCalc-Pro
Команда авторов (Siran Zhao, Ruihui Hou и др.) представила MedCalc-Pro — первый комплексный бенчмарк, охватывающий три уровня сложности:
- Single-calculator: Один инструмент на случай.
- Multi-calculator: Несколько инструментов для одного пациента.
- Nested-calculator: Вложенные вызовы, где результат одного расчета становится входом для другого.
Датасет включает 2 268 реальных клинических случаев, охватывающих 77 медицинских калькуляторов из 14 клинических отделений (кардиология, онкология, педиатрия и др.).
Архитектура агента: как это работает
Для решения задач предложен новый фреймворк агента, который:
- Поддерживает мульти-выбор инструментов (multi-tool selection).
- Реализует вложенные вызовы инструментов (nested-tool calling).
- Использует структурированную валидацию и проверку доказательств (evidence review) для подавления накопления ошибок параметров.
Результаты сравнения
Авторы провели систематическое сравнение с открытыми, закрытыми и специализированными медицинскими LLM. Предложенный фреймворк показал лучшие результаты во всех трех категориях задач. Ниже приведена структура сравнения производительности:
| Категория моделей | Примеры | Результат на MedCalc-Pro |
|---|---|---|
| Open-source LLMs | Llama 3, Mistral, Qwen | Базовый уровень, высокие ошибки вложенных вызовов |
| Closed-source LLMs | GPT-4, Claude 3.5 | Высокая точность, но нестабильность при мульти-инструментах |
| Medical-specialized LLMs | Med-PaLM, BioMedLM | Хорошие результаты, но уступают новому фреймворку в вложенных сценариях |
| MedCalc-Pro Agent (Proposed) | LLM + Custom Agent Framework | Лидер по всем метрикам: точность, надежность, снижение ошибок |
Почему это важно
MedCalc-Pro закрывает критический пробел между «игрушечными» тестами LLM и реальной клинической практикой. Умение модели не просто «знать» формулу, а выбрать правильный инструмент, выполнить цепочку вычислений и проверить результат — это шаг к созданию надежных AI-ассистентов для врачей. Работа опубликована 3 июля 2026 года в arXiv (cs.AI).
Источник: arXiv cs.AI ↗
