Релиз модели17 июля 2026 г., 12:17 МСК🤖 Auto

NVIDIA Nemotron 3 Embed: 8B-модель №1 в RTEB и оптимизация для Blackwell

NVIDIA открыла коллекцию эмбеддинговых моделей Nemotron 3 Embed. Версия 8B заняла первое место в RTEB, а 1B-модель с квантованием NVFP4 обеспечивает до 2x прирост скорости на GPU Blackwell.

Баннер новости 3802

Лидер бенчмарка RTEB и архитектура моделей

NVIDIA представила коллекцию Nemotron 3 Embed, состоящую из трех открытых чекпоинтов, предназначенных для production-масштабного RAG, агентного поиска и работы с памятью AI-агентов. Все модели являются трансформерными энкодерами с двунаправленной маской внимания и максимальным контекстом 32 768 токенов. Базовыми архитектурами служат модели Mistral: 8B-версия построена на базе Ministral-3-8B-Instruct-2512, а 1B-варианты — на Ministral-3-3B-Instruct-2512.

Ключевым достижением стала модель Nemotron-3-Embed-8B-BF16, которая заняла 1-е место в общем зачете Retrieval Embedding Benchmark (RTEB) по состоянию на 17 июля 2026 года. Оценка проводилась по 16 публичным задачам с использованием метрики NDCG@10.

Сравнение производительности

Ниже приведены результаты сравнения новых моделей NVIDIA с предыдущим поколением (llama-nemotron-embed-v2) на ключевых бенчмарках. Обратите внимание на значительный отрыв 8B-модели и высокую эффективность 1B-версий.

Модель Параметры RTEB (Avg NDCG@10) ViDoRe-V3 text MMTEB (Retrieval)
Nemotron-3-Embed-8B-BF16 ~8B 78.46 60.60 75.45
Nemotron-3-Embed-1B-BF16 1.14B 72.38 57.74 71.04
Nemotron-3-Embed-1B-NVFP4 1.14B 72.00
llama-nemotron-embed-vl-1b-v2 61.98 52.54 59.71
llama-nemotron-embed-1b-v2 60.47 52.10 59.58

Путь к 1B: NAS, прунинг и дистилляция

Модель 1B-BF16 не обучалась с нуля, а была получена через сложный пайплайн сжатия. Сначала 3B-родительская модель была прунена до 2B с помощью NVIDIA ModelOpt mcore_minitron Neural Architecture Search (NAS), который оптимизировал ширину скрытых слоев, размер FFN и глубину. Затем 2B-модель прошла дистилляцию от 8B-учителя с использованием комбинации потерь cosine distance (COS) и mean squared error (MSE) на мультиязычных данных. Финальный чекпоинт 1.14B был получен повторением процедуры.

Оптимизация NVFP4 для Blackwell

Для развертывания на GPU нового поколения NVIDIA ввела формат NVFP4. Квантование затронуло веса и активации линейных слоев. Для восстановления точности на длинных последовательностях применялась Quantization-Aware Distillation (QAD) на 20k выборках. Результат: на архитектуре Blackwell NVFP4 обеспечивает до 2x более высокую пропускную способность по сравнению с BF16, сохраняя 99.5% точности (потеря всего 0.38 балла RTEB). Также поддерживается динамическое изменение размерности эмбеддинга (от 512 до 2048).

Деплой и использование

Модели поддерживают работу через Transformers, Sentence Transformers и vLLM (версия 0.25.0+). Для 1B-модели выпущен оптимизированный микросервис NIM на Rust, который показывает лучшие результаты на GB200 и RTX 6000 PRO. Все модели лицензированы по OpenMDW-1.1 и поддерживают 34 языка. Для работы с запросами и документами используются префиксы query: и passage:, а эмбеддинги L2-нормализованы, что позволяет использовать скалярное произведение вместо косинусного сходства.

Бенчмарки

БенчмаркNemotron-3-Embed-8B-BF16Nemotron-3-Embed-1B-BF16Nemotron-3-Embed-1B-NVFP4llama-nemotron-embed-1b-v2llama-nemotron-embed-vl-1b-v2
RTEB78.46%72.38%72%61.98%
ViDoRe-V3 text60.6%57.74%52.1%52.54%
MMTEB (Retrieval)75.45%71.04%59.58%59.71%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗