Архитектурный сдвиг: от эмбеддингов к генерации
Традиционные рекомендательные системы (RecSys), основанные на поиске схожести векторов, сталкиваются с критическими ограничениями при работе с терабайтами данных. NVIDIA предлагает переход к Generative Recommenders (GR), которые формулируют задачу как предсказание следующего действия пользователя: P(next_item | user_history). Это позволяет использовать законы масштабирования (scaling laws) и унифицировать этапы поиска и ранжирования в одной модели.
Ключевые архитектуры: HSTU и Semantic IDs
В основе новых подходов лежат две технологии, адаптированные для GPU NVIDIA:
- HSTU (Hierarchical Sequential Transduction Units): Введенная Meta в 2024 году, эта архитектура заменяет стандартный Softmax на SiLU-взвешивание и относительные смещения внимания. Это сохраняет информацию о величинах в длинных последовательностях и ускоряет инференс за счет слияния CUDA-ядер.
- Semantic IDs (SIDs): Подход от Google, который заменяет огромный каталог товаров на иерархический кластер токенов. Это решает проблему разреженности данных (long-tail problem) и позволяет использовать beam search для генерации рекомендаций за один проход.
Решение проблемы памяти: nv-embedding-cache
Главная боль RecSys — невозможность уместить гигантские таблицы эмбеддингов в HBM видеокарты. NVIDIA представила nv-embedding-cache (NVE) — многоуровневое кэширование с поддержкой шардинга и конкурентного поиска. Это решение работает как прямая замена слоям PyTorch Embedding, обеспечивая низкую задержку даже при работе с петабайтами историй пользователей.
Сравнение подходов
| Характеристика | Traditional RecSys | Generative RecSys (NVIDIA) |
|---|---|---|
| Основной метод | Геометрическая схожесть векторов | Предсказание следующего токена (Sequence Modeling) |
| Обработка длинного хвоста | Слабый сигнал, требует ручной инженерии | Semantic IDs агрегируют нишевые товары в кластеры |
| Холодный старт | Требует корреляции с похожими товарами | Генерация на основе семантических признаков |
| Инфраструктура | Статические таблицы эмбеддингов | DynamicEmb + nv-embedding-cache (HBM-оптимизация) |
Практическое применение
Репозиторий recsys-examples уже содержит готовые реализации для обучения и инференса. Интеграция с Megatron-Core и TorchRec позволяет масштабировать модели на тысячи GPU, что критически важно для сервисов с миллионной аудиторией, где задержка в несколько миллисекунд влияет на конверсию.
Источник: NVIDIA dev blog ↗
