Исследования10 августа 2026 г., 16:18 МСК🤖 Auto

MolBioKG: Как ИИ находит новые лекарства по SMILES-строке

Исследователи представили MolBioKG — систему, которая решает проблему «холодного старта» в биоинформатике, связывая неизвестные молекулы с медицинскими знаниями без дообучения.

Баннер новости 5438

Проблема «неизвестных» молекул

Биомедицинские графы знаний (KG) ускоряют разработку лекарств, но стандартные пайплайны работают только с молекулами, уже присутствующими в графе. Если исследуемое соединение отсутствует в базе (так называемая проблема out-of-graph molecules), система не может найти для него мишени или побочные эффекты. Авторы из Японии и других стран предлагают решение: MolBioKG — двухуровневую систему, которая «заземляет» невидимые молекулы в графе знаний через многоуровневый структурный якорение.

Архитектура и масштаб данных

Система работает без специфического обучения (task-specific training). На вход подается только SMILES-строка молекулы. MolBioKG использует индекс из 2,74 млн молекул, представленных через скаффолды, фрагменты, функциональные группы и отпечатки пальцев (fingerprints). Этот индекс связывается с графом знаний, содержащим 9,6 млн ребер.

Процесс включает два механизма вывода:

  • Статический многоанкерный поиск: использует метод Reciprocal Rank Fusion (RRF) для объединения результатов поиска структурно родственных сущностей.
  • Adapt-KG: инструмент на базе LLM, который действует как агент. Он адаптируется к контексту, выполняя обход графа знаний для сбора доказательств.

Результаты: прорыв в многошаговом рассуждении

Оценка проводилась на задачах восстановления связей, сложного многошагового рассуждения и обобщения для молекул вне графа. MolBioKG демонстрирует значительное улучшение по сравнению с сильными базовыми моделями, особенно в способности находить мишени для новых соединений.

Метрика Базовая модель MolBioKG Прирост
Hits@10 (многошаговое рассуждение) 0.585 0.876 +49.7%
Target Recall (вне графа) 0.145 0.269 +85.5%

Почему это важно

Главное преимущество MolBioKG — не только в точности, но и в интерпретируемости. Предсказания сохраняют прослеживаемые структурные якоря и источники данных из KG. Это позволяет фармацевтам видеть не просто «да/нет», а цепочку логических выводов: почему данная новая молекула может воздействовать на конкретный белок, основываясь на структурном сходстве с уже известными препаратами.

Источник: arXiv cs.AI ↗