Релиз модели16 июля 2026 г., 19:18 МСК🤖 Auto

NVIDIA Nemotron 3 Embed: #1 в RTEB и революция агентов

NVIDIA выпустила линейку моделей встраивания Nemotron 3 Embed. Флагман 8B занял 1-е место в RTEB, а оптимизация NVFP4 на Blackwell снижает затраты токенов агентов.

Баннер новости 3738

Лидерство в RTEB и новые метрики качества

NVIDIA представила линейку моделей Nemotron 3 Embed, спроектированную для повышения точности поиска в системах RAG и агентных рабочих процессах. Флагманская модель Nemotron-3-Embed-8B-BF16 заняла 1-е место в рейтинге RTEB (Retrieval Evaluation Benchmark), показав результат 78.5% по метрике RTEB и 75.5% по MMTEB Retrieval. Это устанавливает новый стандарт точности для enterprise-решений.

Эффективность и снижение затрат агентов

Ключевая инновация — не только точность, но и экономия ресурсов. Более точный поиск позволяет агентам находить релевантные данные раньше, сокращая количество повторных запросов и лишних шагов рассуждения. В тестах на наборах ViDoRe V3, BRIGHT и BrowseComp-Plus использование Nemotron 3 Embed привело к снижению стоимости токенов для модели-агента Nemotron 3 Ultra. Меньше шума в контексте — меньше вычислений на финальном этапе генерации.

Технические характеристики моделей

Линейка включает три модели, закрывающие разные сценарии: от максимальной точности до ультра-высокой пропускной способности. Все модели поддерживают контекстное окно 32k токенов, что критично для длинных документов и истории диалогов.

Модель Роль Ключевые метрики / Особенности
Nemotron-3-Embed-8B-BF16 Флагман качества #1 в RTEB (78.5%), MMTEB 75.5%. Для высокостakes RAG.
Nemotron-3-Embed-1B-BF16 Стандарт эффективности RTEB 72.4%. Ошибка снижена на 27% по сравнению с предшественником (1B v2).
Nemotron-3-Embed-1B-NVFP4 Hardware-ускорение Оптимизация под Blackwell. Пропускная способность до 2x выше BF16. Потеря точности < 1%.

Инфраструктурные преимущества: NVFP4 и NIM

Модель 1B-NVFP4 использует нативное ускорение 4-битной квантизации на архитектурах NVIDIA Blackwell. Это позволяет сократить потребление памяти и увеличить пропускную способность до 2 раз по сравнению с версией BF16, сохраняя более 99% точности. Для развертывания NVIDIA выпустила оптимизированный микросервис NIM на базе Rust, который на GPU GB200 и RTX PRO 6000 показывает производительность, сопоставимую или превосходящую стандартные чекпоинты vLLM.

Открытость и интеграция

Модели доступны на Hugging Face с открытыми весами, датасетами и рецептами для дообучения (fine-tuning) и дистилляции через NVIDIA NeMo AutoModel. Поддержка vLLM и интеграция в AI Cloud партнеров обеспечивают готовность к production-использованию «день в день» (Day-0).

Источник: Hugging Face blog ↗