Устранение узкого места MSA: GPU против CPU
Ключевым этапом в предсказании структур является генерация множественного выравнивания последовательностей (MSA). Традиционно этот процесс выполнялся на CPU с использованием JackHMMER, что создавало серьезное «бутылочное горлышко». NVIDIA интегрировала MMseqs2-GPU в свой BioNeMo Agent Toolkit, перенеся поиск гомологии на графические процессоры.
На архитектурах Hopper и Blackwell (B300) реализованы специфические оптимизации, включая поддержку инструкций DPX в CUDA 13.2. Результаты показывают ускорение до 177 раз по сравнению с CPU-версией JackHMMER на GPU L40S. Задержка при обработке последовательностей длиной более 10 000 токенов масштабируется почти линейно: 429 секунд на H100 и 463 секунды на B300.
cuEquivariance: ускорение инференса OpenFold3
Для самого этапа кофолдинга NVIDIA выпустила библиотеку cuEquivariance, содержащую оптимизированные ядра для Triangle Attention и Triangle Multiplication. Интеграция этих ядер в открытые модели (OpenFold3, RosettaFold3, Boltz) дает двоякий эффект:
- Скорость: сокращение времени прямого прохода (forward-pass) до 3 раз.
- Память: расширение лимита длины последовательности с ~1.5–2.5k токенов (ограничение PyTorch) до ~5.9k токенов.
OpenFold3 NIM и Fold-CP для масштабирования
Сверх этого надстройки работает OpenFold3 NIM (NVIDIA Inference Microservice), который дополнительно оптимизирует инференс, позволяя обрабатывать до 6 400 токенов на одном GPU B300. Для еще более крупных комплексов применяется технология Fold-CP (Context Parallelism). Она снижает требования к памяти на GPU до O(N/P), что позволяет моделировать рибосомные комплексы размером до 32 000 токенов на кластере из 64 GPU B300.
Сравнение производительности cuEquivariance
Ниже приведены данные бенчмарков, демонстрирующие прирост скорости инференса OpenFold3 с использованием cuEquivariance по сравнению с базовой реализацией на PyTorch (OSS).
| Длина последовательности | GPU | PyTorch (OSS) | cuEquivariance | Ускорение |
|---|---|---|---|---|
| 1,024 токена | H100 | 79.4 с | 41.6 с | 1.9× |
| 1,024 токена | B300 | 49.1 с | 27.3 с | 1.8× |
| 1,536 токенов | B300 | 149.0 с | 56.2 с | 2.7× |
| 2,048 токенов | B300 | 300.1 с | 97.6 с | 3.1× |
Значение для индустрии
Эти оптимизации критически важны для виртуального скрининга лекарств, где необходимо проверять миллионы соединений против белковых мишеней, а также для анализа крупных молекулярных ансамблей. Теперь AI-агенты могут автономно запускать весь пайплайн — от поиска гомологии до предсказания структуры — без ручного вмешательства и простоя на этапах вычислений.
Источник: NVIDIA dev blog ↗
