Исследования14 сентября 2026 г., 10:16 МСК🤖 Auto

HypoKG: LLM-генерация гипотез в биомедицине с опорой на графы знаний

Исследование HypoKG доказывает: LLM создают убедительные, но поверхностные гипотезы, если видят только начало и конец задачи. Полные биохимические пути из KEGG и UniProt повышают научную достоверность выводов.

Баннер новости 7430

Проблема «убедительной лжи» в биомедицинских LLM

Большие языковые модели (LLM) способны генерировать биомедицинские гипотезы, но остается открытым вопрос: действительно ли они рассуждают на основе научных доказательств или просто выдают правдоподобные идеи? Исследование HypoKG, представленное на EMNLP 2026, ставит эксперимент, чтобы проверить, насколько модели опираются на фактические биологические пути, а не только на статистическую вероятность слов.

Методология: 550 путей и 13 200 гипотез

Авторы (Dominic Okonkwo, Adetayo Okunoye, Ismailcem Budak Arpinar) создали унифицированный биохимический граф знаний, объединив три крупные базы данных: KEGG, Rhea и UniProt. На основе этого графа был сформирован бенчмарк из 550 путей, соединяющих ферменты-источники с редкими заболеваниями. В эксперименте участвовали шесть LLM, которые генерировали гипотезы в четырех условиях:

  • Только фермент-источник;
  • Полный биологический путь;
  • Только источник и конечная точка (заболевание);
  • Полный путь с перемешанными промежуточными шагами (для контроля).

Итого было сгенерировано 13 200 гипотез, оцененных экспертами по пятикритериальной шкале (1–5).

Ключевые результаты: «Evidence-Disciplined Reasoning»

Результаты показали четкое разделение между «красивыми» и «научно обоснованными» гипотезами. Модели, получившие только начало и конец задачи (источник и болезнь), часто выдавали гипотезы с наивысшими баллами за убедительность, но они были наименее обоснованы фактами. Напротив, модели, получившие полный биологический путь, генерировали гипотезы, более согласованные с известными механизмами.

Для подтверждения того, что модели действительно используют структуру пути, а не просто запоминают пары, исследователи перемешали промежуточные шаги пути, оставив концы неизменными. Это привело к статистически значимому падению качества обоснования:

Условие эксперимента Результат (Grounding Score) Статистическая значимость
Полный биологический путь (контроль) Базовый уровень
Путь с перемешанными шагами Δ = -0.793 p < 0.001
Только источник и болезнь (без пути) Высокая убедительность, низкая обоснованность

Значение delta в -0.793 при p < 0.001 подтверждает: LLM genuinely используют структуру пути для рассуждений, а не просто имитируют логику.

Значение для науки и индустрии

Работа HypoKG демонстрирует, что графы знаний поддерживают генерацию гипотез двумя способами:

  1. Поиск пробелов: выявление пар биологических конечных точек, отсутствующих в текущей литературе.
  2. Направление рассуждений: механистические пути из графов служат «скелетом», на который LLM нанизывает логические связи, избегая галлюцинаций.

Это открывает путь к созданию гибридных систем, где LLM выступают в роли гипотез-генераторов, а графы знаний — в роли строгого редактора, обеспечивающего соответствие биологическим реалиям.

Источник: arXiv cs.CL ↗