Проблема «неизвестных» молекул
Биомедицинские графы знаний (KG) ускоряют разработку лекарств, но стандартные пайплайны работают только с молекулами, уже присутствующими в графе. Если исследуемое соединение отсутствует в базе (так называемая проблема out-of-graph molecules), система не может найти для него мишени или побочные эффекты. Авторы из Японии и других стран предлагают решение: MolBioKG — двухуровневую систему, которая «заземляет» невидимые молекулы в графе знаний через многоуровневый структурный якорение.
Архитектура и масштаб данных
Система работает без специфического обучения (task-specific training). На вход подается только SMILES-строка молекулы. MolBioKG использует индекс из 2,74 млн молекул, представленных через скаффолды, фрагменты, функциональные группы и отпечатки пальцев (fingerprints). Этот индекс связывается с графом знаний, содержащим 9,6 млн ребер.
Процесс включает два механизма вывода:
- Статический многоанкерный поиск: использует метод Reciprocal Rank Fusion (RRF) для объединения результатов поиска структурно родственных сущностей.
- Adapt-KG: инструмент на базе LLM, который действует как агент. Он адаптируется к контексту, выполняя обход графа знаний для сбора доказательств.
Результаты: прорыв в многошаговом рассуждении
Оценка проводилась на задачах восстановления связей, сложного многошагового рассуждения и обобщения для молекул вне графа. MolBioKG демонстрирует значительное улучшение по сравнению с сильными базовыми моделями, особенно в способности находить мишени для новых соединений.
| Метрика | Базовая модель | MolBioKG | Прирост |
|---|---|---|---|
| Hits@10 (многошаговое рассуждение) | 0.585 | 0.876 | +49.7% |
| Target Recall (вне графа) | 0.145 | 0.269 | +85.5% |
Почему это важно
Главное преимущество MolBioKG — не только в точности, но и в интерпретируемости. Предсказания сохраняют прослеживаемые структурные якоря и источники данных из KG. Это позволяет фармацевтам видеть не просто «да/нет», а цепочку логических выводов: почему данная новая молекула может воздействовать на конкретный белок, основываясь на структурном сходстве с уже известными препаратами.
Источник: arXiv cs.AI ↗
