Проблема арифметики в медицине
Большие языковые модели (LLM) исторически ненадежны в вычислениях. В клинической практике, где одна ошибка в цифре может изменить рекомендацию по лечению, это критично. Стандартное решение — хардкод каждого калькулятора как валидированной функции. Авторы статьи "Towards a Deterministic Math Solver for Clinical Language Models" (arXiv:2609.10728) предлагают альтернативу: модель не выполняет вычисления сама, а пишет специфичный для случая Python-код, который запускается в изолированном детерминированном исполнителе.
Методология и аудит формул
Команда протестировала этот подход на наборе данных MedCalc-Bench Verified, включающем 1 100 случаев и 55 калькуляторов. Перед тестированием формулы были проверены на соответствие текущим клиническим рекомендациям. Выяснилось, что 16 из 55 формул имели проблемы с версией, использованием или коэффициентами, что требует особой осторожности при внедрении.
Результаты сравнения моделей
Эксперименты проводились на моделях Qwen2.5-7B и Qwen2.5-32B-AWQ. Результаты показали, что использование Python-исполнителя дает значимое преимущество только для более крупных моделей, обеспечивая точность, близкую к ручному коду, но с возможностью обработки большего числа сценариев.
| Метод / Модель | Точность (Accuracy) | Примечание |
|---|---|---|
| Qwen2.5-32B + Python Solver | 90.53% | Лучший результат, +7.05% к прямой арифметике |
| Qwen2.5-32B Прямая арифметика | 83.47% | Базовый уровень без исполнителя |
| Qwen2.5-7B + Python Solver | 75.31% | Незначительное улучшение (+3.29 п.п.) |
| Qwen2.5-7B Прямая арифметика | 72.02% | Базовый уровень для 7B |
| Ручная библиотека (22 калькулятора) | 100% (на 440 случаях) | Abstains (отказывается отвечать) в 40% остальных случаев |
Выводы для индустрии
Исследование доказывает, что передача вычислений детерминированному исполнителю помогает некоторым открытым моделям (особенно 32B) достичь высокой надежности. Однако это не заменяет необходимость верифицированных формул и надежного извлечения переменных из медицинских заметок. Подход особенно актуален для создания клинических помощников, где цена ошибки минимальна, а точность — максимальна.
Источник: arXiv cs.AI ↗
