Исследования7 июля 2026 г., 11:18 МСК🤖 Auto

MedCalc-Pro: LLM-агенты решают сложные мед. расчеты с точностью до 90%

Исследователи представили MedCalc-Pro — новый бенчмарк и фреймворк для LLM-агентов, способных выполнять многошаговые медицинские вычисления в реальных клинических сценариях.

Баннер новости 3019

Проблема упрощенных бенчмарков

Существующие тесты для оценки больших языковых моделей (LLM) в медицине часто искусственно упрощены: один пациент — один калькулятор, инструмент явно указан в запросе. В реальной клинической практике врачи сталкиваются с множественными калькуляторами, вложенными вычислениями и нечеткими запросами, где модель должна сама определить нужные инструменты. Это приводит к ошибкам, которые в медицине недопустимы.

Что такое MedCalc-Pro

Команда авторов (Siran Zhao, Ruihui Hou и др.) представила MedCalc-Pro — первый комплексный бенчмарк, охватывающий три уровня сложности:

  • Single-calculator: Один инструмент на случай.
  • Multi-calculator: Несколько инструментов для одного пациента.
  • Nested-calculator: Вложенные вызовы, где результат одного расчета становится входом для другого.

Датасет включает 2 268 реальных клинических случаев, охватывающих 77 медицинских калькуляторов из 14 клинических отделений (кардиология, онкология, педиатрия и др.).

Архитектура агента: как это работает

Для решения задач предложен новый фреймворк агента, который:

  • Поддерживает мульти-выбор инструментов (multi-tool selection).
  • Реализует вложенные вызовы инструментов (nested-tool calling).
  • Использует структурированную валидацию и проверку доказательств (evidence review) для подавления накопления ошибок параметров.

Результаты сравнения

Авторы провели систематическое сравнение с открытыми, закрытыми и специализированными медицинскими LLM. Предложенный фреймворк показал лучшие результаты во всех трех категориях задач. Ниже приведена структура сравнения производительности:

Категория моделей Примеры Результат на MedCalc-Pro
Open-source LLMs Llama 3, Mistral, Qwen Базовый уровень, высокие ошибки вложенных вызовов
Closed-source LLMs GPT-4, Claude 3.5 Высокая точность, но нестабильность при мульти-инструментах
Medical-specialized LLMs Med-PaLM, BioMedLM Хорошие результаты, но уступают новому фреймворку в вложенных сценариях
MedCalc-Pro Agent (Proposed) LLM + Custom Agent Framework Лидер по всем метрикам: точность, надежность, снижение ошибок

Почему это важно

MedCalc-Pro закрывает критический пробел между «игрушечными» тестами LLM и реальной клинической практикой. Умение модели не просто «знать» формулу, а выбрать правильный инструмент, выполнить цепочку вычислений и проверить результат — это шаг к созданию надежных AI-ассистентов для врачей. Работа опубликована 3 июля 2026 года в arXiv (cs.AI).

Источник: arXiv cs.AI ↗