Исследования12 сентября 2026 г., 09:16 МСК🤖 Auto

Клинические LLM решают математику через Python: новый подход к точности

Исследователи представили метод, где LLM не считают, а генерируют код для детерминированного исполнителя. На MedCalc-Bench это дало прирост точности до 90.5% для моделей 32B.

Баннер новости 7336

Проблема арифметики в медицине

Большие языковые модели (LLM) исторически ненадежны в вычислениях. В клинической практике, где одна ошибка в цифре может изменить рекомендацию по лечению, это критично. Стандартное решение — хардкод каждого калькулятора как валидированной функции. Авторы статьи "Towards a Deterministic Math Solver for Clinical Language Models" (arXiv:2609.10728) предлагают альтернативу: модель не выполняет вычисления сама, а пишет специфичный для случая Python-код, который запускается в изолированном детерминированном исполнителе.

Методология и аудит формул

Команда протестировала этот подход на наборе данных MedCalc-Bench Verified, включающем 1 100 случаев и 55 калькуляторов. Перед тестированием формулы были проверены на соответствие текущим клиническим рекомендациям. Выяснилось, что 16 из 55 формул имели проблемы с версией, использованием или коэффициентами, что требует особой осторожности при внедрении.

Результаты сравнения моделей

Эксперименты проводились на моделях Qwen2.5-7B и Qwen2.5-32B-AWQ. Результаты показали, что использование Python-исполнителя дает значимое преимущество только для более крупных моделей, обеспечивая точность, близкую к ручному коду, но с возможностью обработки большего числа сценариев.

Метод / Модель Точность (Accuracy) Примечание
Qwen2.5-32B + Python Solver 90.53% Лучший результат, +7.05% к прямой арифметике
Qwen2.5-32B Прямая арифметика 83.47% Базовый уровень без исполнителя
Qwen2.5-7B + Python Solver 75.31% Незначительное улучшение (+3.29 п.п.)
Qwen2.5-7B Прямая арифметика 72.02% Базовый уровень для 7B
Ручная библиотека (22 калькулятора) 100% (на 440 случаях) Abstains (отказывается отвечать) в 40% остальных случаев

Выводы для индустрии

Исследование доказывает, что передача вычислений детерминированному исполнителю помогает некоторым открытым моделям (особенно 32B) достичь высокой надежности. Однако это не заменяет необходимость верифицированных формул и надежного извлечения переменных из медицинских заметок. Подход особенно актуален для создания клинических помощников, где цена ошибки минимальна, а точность — максимальна.

Источник: arXiv cs.AI ↗