Проблема «убедительной лжи» в биомедицинских LLM
Большие языковые модели (LLM) способны генерировать биомедицинские гипотезы, но остается открытым вопрос: действительно ли они рассуждают на основе научных доказательств или просто выдают правдоподобные идеи? Исследование HypoKG, представленное на EMNLP 2026, ставит эксперимент, чтобы проверить, насколько модели опираются на фактические биологические пути, а не только на статистическую вероятность слов.
Методология: 550 путей и 13 200 гипотез
Авторы (Dominic Okonkwo, Adetayo Okunoye, Ismailcem Budak Arpinar) создали унифицированный биохимический граф знаний, объединив три крупные базы данных: KEGG, Rhea и UniProt. На основе этого графа был сформирован бенчмарк из 550 путей, соединяющих ферменты-источники с редкими заболеваниями. В эксперименте участвовали шесть LLM, которые генерировали гипотезы в четырех условиях:
- Только фермент-источник;
- Полный биологический путь;
- Только источник и конечная точка (заболевание);
- Полный путь с перемешанными промежуточными шагами (для контроля).
Итого было сгенерировано 13 200 гипотез, оцененных экспертами по пятикритериальной шкале (1–5).
Ключевые результаты: «Evidence-Disciplined Reasoning»
Результаты показали четкое разделение между «красивыми» и «научно обоснованными» гипотезами. Модели, получившие только начало и конец задачи (источник и болезнь), часто выдавали гипотезы с наивысшими баллами за убедительность, но они были наименее обоснованы фактами. Напротив, модели, получившие полный биологический путь, генерировали гипотезы, более согласованные с известными механизмами.
Для подтверждения того, что модели действительно используют структуру пути, а не просто запоминают пары, исследователи перемешали промежуточные шаги пути, оставив концы неизменными. Это привело к статистически значимому падению качества обоснования:
| Условие эксперимента | Результат (Grounding Score) | Статистическая значимость |
|---|---|---|
| Полный биологический путь (контроль) | Базовый уровень | — |
| Путь с перемешанными шагами | Δ = -0.793 | p < 0.001 |
| Только источник и болезнь (без пути) | Высокая убедительность, низкая обоснованность | — |
Значение delta в -0.793 при p < 0.001 подтверждает: LLM genuinely используют структуру пути для рассуждений, а не просто имитируют логику.
Значение для науки и индустрии
Работа HypoKG демонстрирует, что графы знаний поддерживают генерацию гипотез двумя способами:
- Поиск пробелов: выявление пар биологических конечных точек, отсутствующих в текущей литературе.
- Направление рассуждений: механистические пути из графов служат «скелетом», на который LLM нанизывает логические связи, избегая галлюцинаций.
Это открывает путь к созданию гибридных систем, где LLM выступают в роли гипотез-генераторов, а графы знаний — в роли строгого редактора, обеспечивающего соответствие биологическим реалиям.
Источник: arXiv cs.CL ↗
