Проблема: D-пептиды и слепое пятно ProteinMPNN
D-пептиды (зеркальные изомеры L-пептидов) обладают устойчивостью к протеазам и высокой специфичностью, но их вычислительный дизайн остается сложной задачей. Ранее предложенный пайплайн Mirror-Peptidizer использовал ProteinMPNN для генерации последовательностей, однако его сырой скоринг на основе отрицательного логарифма правдоподобия (NLL) не был валидирован против измеренных аффинностей. На практике это привело к тому, что из 9 протестированных дизайнов для белка MDM2 связывание детектировалось лишь у 4.
Решение: Mirror-Score и Boltz-2
Авторы представляют Mirror-Score — калиброванную систему скоринга, работающую только на этапе инференса (inference-only), предназначенную для гетерохиральных комплексов D-пептид/L-белок. В основе лежит модель Boltz-2, оценивающая уверенность кофолдинга. Для валидации создан публичный бенчмарк из 31 кристаллографического комплекса (4 семейства), включая 18 структур с подтвержденными в литературе аффинностями.
Ключевые метрики: NLL против pLDDT
Исследование показало, что сырой NLL ProteinMPNN не является валидным ранкером аффинности. Корреляция Спирмена (Spearman rho) варьируется от отрицательной до положительной в зависимости от целевого белка, что делает его использование для отбора кандидатов рискованным. В противовес этому, интерфейс predicted local distance difference test (pLDDT) от Boltz-2 продемонстрировал стабильность.
| Метрика / Модель | Целевой белок | Корреляция Спирмена (rho) | Интерпретация |
|---|---|---|---|
| ProteinMPNN (NLL) | MDM2 / CHIP | +0.62 | Положительная корреляция, но не универсальна |
| ProteinMPNN (NLL) | gp41 | -0.70 | Обратная корреляция (ошибочное ранжирование) |
| ProteinMPNN (NLL) (общая) | Все данные | 0.19 | Слабая/отсутствующая связь с аффинностью |
| Boltz-2 (pLDDT интерфейса) | Семейство вирусного входа (gp41) | 0.90 | Высокая точность, корректно упорядочил 3 пептида |
| Boltz-2 (pLDDT интерфейса) | Семейство вирусного входа (NLL) | 0.18 | Неэффективность NLL на уровне структуры |
Важные ограничения и выводы
Хотя pLDDT от Boltz-2 показал высокую корреляцию (rho = 0.90, p = 0.006) для семейства вирусного входа, авторы подчеркивают, что выборка ограничена всего тремя независимыми химическими типами. Это указывает на направленную согласованность, а не на статистически подтвержденный предиктор. Кроме того, кросс-семейная калибровка не переносится при текущих объемах данных, что делает калибровку внутри семейства единственным практичным режимом развертывания.
Применение: борьба с устойчивостью к антибиотикам
На основе выводов исследования авторы предлагают протокол перспективного дизайна для мишеней LasR и LecB бактерии Pseudomonas aeruginosa, связанных с антимикробной резистентностью. Протокол включает зеркальные структуры, карты горячих точек (hotspot maps) и подготовку входных данных для диффузионных моделей. Все код, данные и скрипты анализа опубликованы в открытом доступе.
Источник: arXiv cs.AI ↗
