Инструменты1 октября 2026 г., 00:01 МСК🤖 Auto

NVIDIA Dynamo: ускорение генеративных рекомендательных систем HSTU

NVIDIA представила решение на базе Triton Inference Server для развертывания генеративных рекомендательных систем (GR) с архитектурой HSTU, заменяющей традиционные этапы ранжирования на моделирование последовательностей.

Баннер новости 8640

От ранжирования к генерации: новый подход к персонализации

Традиционные системы рекомендаций разделяют процесс на изолированные этапы: извлечение (retrieval), ранжирование (ranking) и предсказание. NVIDIA предлагает парадигмальный сдвиг, объединяя эти стадии в единую генеративную рекомендательную систему (GR). В этой модели взаимодействия пользователя, контекст и кандидаты преобразуются в токены высокоразмерного потока событий, а рекомендация формируется как задача моделирования последовательностей (sequence modeling).

Техническая реализация: HSTU и NVIDIA Dynamo

Для эффективного развертывания таких моделей NVIDIA использует NVIDIA Dynamo в связке с Triton Inference Server. Ключевым компонентом является архитектура HSTU (Hierarchical Sparse Token Unit), которая позволяет обрабатывать разреженные токены с высокой пропускной способностью. Это решение критически важно для снижения задержек (latency) при работе с огромными пространствами кандидатов, характерными для крупных платформ.

Почему это важно для индустрии

  • Снижение сложности пайплайна: Устранение необходимости в множестве отдельных моделей ранжирования упрощает инфраструктуру и снижает накладные расходы на обслуживание.
  • Улучшение качества: Моделирование последовательностей позволяет учитывать долгосрочные паттерны поведения пользователя, что часто дает более релевантные результаты, чем статические признаки.
  • Масштабируемость: Интеграция с Triton обеспечивает готовую к продакшену среду для обслуживания тяжелых нейросетевых моделей в реальном времени.

Практическое применение

Развертывание HSTU через NVIDIA Dynamo открывает путь для компаний, работающих с большими данными (e-commerce, медиа, социальные сети). Это позволяет перейти от «угадывания» предпочтений через классификацию к их «генерации» на основе контекстного понимания поведения пользователя.

Источник: NVIDIA dev blog ↗