Исследования2 июля 2026 г., 12:15 МСК🤖 Auto

Медицинские LLM галлюцинируют: нейронный контроль не работает

Исследование arXiv:2607.00158 доказывает, что галлюцинации медицинских LLM можно легко обнаружить на уровне нейронов, но исправить их целенаправленным управлением этими нейронами невозможно.

Баннер новости 2794

Проблема обнаружения vs. контроля

Галлюцинации остаются главным барьером для внедрения больших языковых моделей (LLM) в медицину. Традиционные подходы фокусируются на пост-фактум детекции ошибок. Однако новое исследование авторов Vijay Vankadaru, Asha Matthews, Tanya Roosta и Peyman Passban ставит под сомнение саму возможность «лечения» модели через манипуляцию её внутренними представлениями. Ученые выяснили, что хотя галлюцинации легко считываются из активаций нейронов, попытка изменить эти активации для предотвращения ошибок не дает стабильного результата.

Методология и метрики

Исследователи протестировали четыре открытые модели на наборах данных для медицинского问答 (QA). Ключевым инструментом стал «зонд» (probe) — простая линейная модель, обученная предсказывать наличие галлюцинации по активациям скрытых слоев. Результаты показали высокую предсказуемость:

  • AUROC: от 0.77 до 0.86, что свидетельствует о надежном обнаружении ошибок.
  • Распределенность: сигнал о галлюцинации не локализован в одном «нейроне-виновнике», а распределен по всей сети и избыточен.

Важно отметить, что случайные подмножества из нескольких сотен нейронов восстанавливают почти полный сигнал детекции, в то время как систематически отобранные нейроны превосходят случайные только при очень малых размерах выборок.

Эксперимент по каузальному контролю

Самый важный вывод сделан на этапе тестирования каузальной управляемости. Авторы проверили, можно ли, вмешиваясь в активации нейронов, связанных с галлюцинациями, заставить модель давать правильные ответы. Тестирование проводилось на 16 комбинациях «модель-датасет».

Результаты выявили резкий разрыв между декодируемостью (возможностью прочитать ошибку) и контролируемостью (возможностью её исправить). Структура, делающая галлюцинацию видимой для зонда, не позволяет использовать её для точечной коррекции поведения модели. Простое «выключение» или «включение» целевых нейронов не приводит к предсказуемому улучшению качества ответов.

Почему это важно для индустрии

Результаты исследования бросают вызов популярному направлению интерпретируемости ИИ, которое предполагает, что если мы найдем «нейрон, отвечающий за ложь», мы сможем его отключить. Для медицинских LLM это означает, что стратегии mitigation (снижения рисков) не могут сводиться только к поиску и изоляции конкретных нейронов. Необходим более глубокий подход к архитектуре и обучению, учитывающий, что внутренние представления, раскрывающие суть ошибки, не всегда дают рычаги управления этой ошибкой.

Источник: arXiv cs.CL ↗