Инструменты20 августа 2026 г., 19:23 МСК🤖 Auto

NVIDIA представила Generative RecSys: HSTU, Semantic IDs и nv-embedding-cache

NVIDIA открыла репозиторий recsys-examples, внедряя генеративные рекомендательные системы на базе трансформеров. Новые инструменты решают проблемы масштабируемости, холодного старта и задержек в реальном времени.

Баннер новости 6174

Архитектурный сдвиг: от эмбеддингов к генерации

Традиционные рекомендательные системы (RecSys), основанные на поиске схожести векторов, сталкиваются с критическими ограничениями при работе с терабайтами данных. NVIDIA предлагает переход к Generative Recommenders (GR), которые формулируют задачу как предсказание следующего действия пользователя: P(next_item | user_history). Это позволяет использовать законы масштабирования (scaling laws) и унифицировать этапы поиска и ранжирования в одной модели.

Ключевые архитектуры: HSTU и Semantic IDs

В основе новых подходов лежат две технологии, адаптированные для GPU NVIDIA:

  • HSTU (Hierarchical Sequential Transduction Units): Введенная Meta в 2024 году, эта архитектура заменяет стандартный Softmax на SiLU-взвешивание и относительные смещения внимания. Это сохраняет информацию о величинах в длинных последовательностях и ускоряет инференс за счет слияния CUDA-ядер.
  • Semantic IDs (SIDs): Подход от Google, который заменяет огромный каталог товаров на иерархический кластер токенов. Это решает проблему разреженности данных (long-tail problem) и позволяет использовать beam search для генерации рекомендаций за один проход.

Решение проблемы памяти: nv-embedding-cache

Главная боль RecSys — невозможность уместить гигантские таблицы эмбеддингов в HBM видеокарты. NVIDIA представила nv-embedding-cache (NVE) — многоуровневое кэширование с поддержкой шардинга и конкурентного поиска. Это решение работает как прямая замена слоям PyTorch Embedding, обеспечивая низкую задержку даже при работе с петабайтами историй пользователей.

Сравнение подходов

ХарактеристикаTraditional RecSysGenerative RecSys (NVIDIA)
Основной методГеометрическая схожесть векторовПредсказание следующего токена (Sequence Modeling)
Обработка длинного хвостаСлабый сигнал, требует ручной инженерииSemantic IDs агрегируют нишевые товары в кластеры
Холодный стартТребует корреляции с похожими товарамиГенерация на основе семантических признаков
ИнфраструктураСтатические таблицы эмбеддинговDynamicEmb + nv-embedding-cache (HBM-оптимизация)

Практическое применение

Репозиторий recsys-examples уже содержит готовые реализации для обучения и инференса. Интеграция с Megatron-Core и TorchRec позволяет масштабировать модели на тысячи GPU, что критически важно для сервисов с миллионной аудиторией, где задержка в несколько миллисекунд влияет на конверсию.

Источник: NVIDIA dev blog ↗