Исследования3 октября 2026 г., 06:17 МСК🤖 Auto

MedKIT: Почему LLM помнят факты, но не умеют их применять

Исследование MedKIT (NeurIPS 2026) выявило критический разрыв между фактологической памятью и практическим применением знаний в медицинских LLM. Обновление данных не гарантирует безопасности.

Баннер новости 8836

Проблема «мертвых» знаний в медицине

В медицине клинические рекомендации устаревают быстрее, чем модели успевают переобучаться. Старые данные создают риски для пациентов. Традиционные бенчмарки проверяют только фактологическое воспроизведение (recall), но не отвечают на вопрос: может ли модель использовать новые знания в реальных сценариях? Исследование MedKIT, принятое в NeurIPS 2026 (Evaluations & Datasets Track), закрывает этот пробел, оценивая интеграцию знаний через призму обобщения (generalization).

Методология: 12 стратегий и 5 моделей

Авторы (Lukas Thede, Zeynep Akata и др.) провели масштабный эмпирический анализ 12 стратегий интеграции знаний на 5 разнообразных моделях, включая общие и медицинские LLM. Каждая задача в MedKIT — это фактическое обновление, основанное на клинических доказательствах, с проверкой по четырем ключевым направлениям:

  • Лексическая вариация: Понимает ли модель суть, если изменить формулировку вопроса?
  • Реляционные трансформации: Может ли она вывести новые связи из обновленных фактов?
  • Композиционное рассуждение: Способна ли комбинировать новое знание с уже имеющимся?
  • Открытая операционализация: Может ли сформулировать клиническое решение на основе новых данных?

Ключевые результаты: разрыв между памятью и умением

Результаты показали устойчивый разрыв между способностью модели «запомнить» факт и ее способностью его применить. Большинство методов показали рост точности на прямой задаче обновления, но провалились на более сложных тестах.

Тип проверки Результат Значение для индустрии
Прямое воспроизведение (Recall) Сильный рост Модели эффективно запоминают новые факты.
Лексическая вариация Хорошие показатели Модели устойчивы к синонимам в вопросах.
Реляционное обобщение Ограниченное Сложность в выводе новых связей между фактами.
Композиция и операционализация Нет улучшений Модели не могут использовать новые знания для сложных клинических решений.

Почему это важно для безопасности AI

Отсутствие улучшений в задачах композиционного рассуждения и операционализации указывает на фундаментальную проблему: текущие методы интеграции знаний делают модели «запоминающими», но не «понимающими» контекст. Для медицинских приложений это критично, так как врачам нужны не просто факты, а готовые клинические рекомендации. MedKIT позиционируется как новый стандарт (testbed) для разработки методов, которые обеспечат не просто обновление базы данных, а реальную применимость знаний в динамичной среде.

Источник: arXiv cs.CL ↗