Исследования30 сентября 2026 г., 11:17 МСК🤖 Auto

Mirror-Score: почему ProteinMPNN не предсказывает аффинность D-пептидов

Исследование Jiada Li демонстрирует, что сырой скоринг ProteinMPNN (NLL) невалиден для ранжирования аффинности D-пептидов. Представлен Mirror-Score на базе Boltz-2, показавший высокую корреляцию с экспериментальными данными.

Баннер новости 8585

Проблема: D-пептиды и слепое пятно ProteinMPNN

D-пептиды (зеркальные изомеры L-пептидов) обладают устойчивостью к протеазам и высокой специфичностью, но их вычислительный дизайн остается сложной задачей. Ранее предложенный пайплайн Mirror-Peptidizer использовал ProteinMPNN для генерации последовательностей, однако его сырой скоринг на основе отрицательного логарифма правдоподобия (NLL) не был валидирован против измеренных аффинностей. На практике это привело к тому, что из 9 протестированных дизайнов для белка MDM2 связывание детектировалось лишь у 4.

Решение: Mirror-Score и Boltz-2

Авторы представляют Mirror-Score — калиброванную систему скоринга, работающую только на этапе инференса (inference-only), предназначенную для гетерохиральных комплексов D-пептид/L-белок. В основе лежит модель Boltz-2, оценивающая уверенность кофолдинга. Для валидации создан публичный бенчмарк из 31 кристаллографического комплекса (4 семейства), включая 18 структур с подтвержденными в литературе аффинностями.

Ключевые метрики: NLL против pLDDT

Исследование показало, что сырой NLL ProteinMPNN не является валидным ранкером аффинности. Корреляция Спирмена (Spearman rho) варьируется от отрицательной до положительной в зависимости от целевого белка, что делает его использование для отбора кандидатов рискованным. В противовес этому, интерфейс predicted local distance difference test (pLDDT) от Boltz-2 продемонстрировал стабильность.

Метрика / Модель Целевой белок Корреляция Спирмена (rho) Интерпретация
ProteinMPNN (NLL) MDM2 / CHIP +0.62 Положительная корреляция, но не универсальна
ProteinMPNN (NLL) gp41 -0.70 Обратная корреляция (ошибочное ранжирование)
ProteinMPNN (NLL) (общая) Все данные 0.19 Слабая/отсутствующая связь с аффинностью
Boltz-2 (pLDDT интерфейса) Семейство вирусного входа (gp41) 0.90 Высокая точность, корректно упорядочил 3 пептида
Boltz-2 (pLDDT интерфейса) Семейство вирусного входа (NLL) 0.18 Неэффективность NLL на уровне структуры

Важные ограничения и выводы

Хотя pLDDT от Boltz-2 показал высокую корреляцию (rho = 0.90, p = 0.006) для семейства вирусного входа, авторы подчеркивают, что выборка ограничена всего тремя независимыми химическими типами. Это указывает на направленную согласованность, а не на статистически подтвержденный предиктор. Кроме того, кросс-семейная калибровка не переносится при текущих объемах данных, что делает калибровку внутри семейства единственным практичным режимом развертывания.

Применение: борьба с устойчивостью к антибиотикам

На основе выводов исследования авторы предлагают протокол перспективного дизайна для мишеней LasR и LecB бактерии Pseudomonas aeruginosa, связанных с антимикробной резистентностью. Протокол включает зеркальные структуры, карты горячих точек (hotspot maps) и подготовку входных данных для диффузионных моделей. Все код, данные и скрипты анализа опубликованы в открытом доступе.

Источник: arXiv cs.AI ↗