Релиз модели10 июля 2026 г., 16:16 МСК🤖 Auto

NVIDIA BioNeMo: ускорение кофолдинга белков в 177 раз на B300

NVIDIA представила полный стек ускорения для предсказания структур белков: MMseqs2-GPU, cuEquivariance и Fold-CP. Это позволяет моделировать комплексы до 32 000 токенов на 64 GPU B300.

Баннер новости 3304

Устранение узкого места MSA: GPU против CPU

Ключевым этапом в предсказании структур является генерация множественного выравнивания последовательностей (MSA). Традиционно этот процесс выполнялся на CPU с использованием JackHMMER, что создавало серьезное «бутылочное горлышко». NVIDIA интегрировала MMseqs2-GPU в свой BioNeMo Agent Toolkit, перенеся поиск гомологии на графические процессоры.

На архитектурах Hopper и Blackwell (B300) реализованы специфические оптимизации, включая поддержку инструкций DPX в CUDA 13.2. Результаты показывают ускорение до 177 раз по сравнению с CPU-версией JackHMMER на GPU L40S. Задержка при обработке последовательностей длиной более 10 000 токенов масштабируется почти линейно: 429 секунд на H100 и 463 секунды на B300.

cuEquivariance: ускорение инференса OpenFold3

Для самого этапа кофолдинга NVIDIA выпустила библиотеку cuEquivariance, содержащую оптимизированные ядра для Triangle Attention и Triangle Multiplication. Интеграция этих ядер в открытые модели (OpenFold3, RosettaFold3, Boltz) дает двоякий эффект:

  1. Скорость: сокращение времени прямого прохода (forward-pass) до 3 раз.
  2. Память: расширение лимита длины последовательности с ~1.5–2.5k токенов (ограничение PyTorch) до ~5.9k токенов.

OpenFold3 NIM и Fold-CP для масштабирования

Сверх этого надстройки работает OpenFold3 NIM (NVIDIA Inference Microservice), который дополнительно оптимизирует инференс, позволяя обрабатывать до 6 400 токенов на одном GPU B300. Для еще более крупных комплексов применяется технология Fold-CP (Context Parallelism). Она снижает требования к памяти на GPU до O(N/P), что позволяет моделировать рибосомные комплексы размером до 32 000 токенов на кластере из 64 GPU B300.

Сравнение производительности cuEquivariance

Ниже приведены данные бенчмарков, демонстрирующие прирост скорости инференса OpenFold3 с использованием cuEquivariance по сравнению с базовой реализацией на PyTorch (OSS).

Длина последовательности GPU PyTorch (OSS) cuEquivariance Ускорение
1,024 токена H100 79.4 с 41.6 с 1.9×
1,024 токена B300 49.1 с 27.3 с 1.8×
1,536 токенов B300 149.0 с 56.2 с 2.7×
2,048 токенов B300 300.1 с 97.6 с 3.1×

Значение для индустрии

Эти оптимизации критически важны для виртуального скрининга лекарств, где необходимо проверять миллионы соединений против белковых мишеней, а также для анализа крупных молекулярных ансамблей. Теперь AI-агенты могут автономно запускать весь пайплайн — от поиска гомологии до предсказания структуры — без ручного вмешательства и простоя на этапах вычислений.

Источник: NVIDIA dev blog ↗