Лидерство в RTEB и новые метрики качества
NVIDIA представила линейку моделей Nemotron 3 Embed, спроектированную для повышения точности поиска в системах RAG и агентных рабочих процессах. Флагманская модель Nemotron-3-Embed-8B-BF16 заняла 1-е место в рейтинге RTEB (Retrieval Evaluation Benchmark), показав результат 78.5% по метрике RTEB и 75.5% по MMTEB Retrieval. Это устанавливает новый стандарт точности для enterprise-решений.
Эффективность и снижение затрат агентов
Ключевая инновация — не только точность, но и экономия ресурсов. Более точный поиск позволяет агентам находить релевантные данные раньше, сокращая количество повторных запросов и лишних шагов рассуждения. В тестах на наборах ViDoRe V3, BRIGHT и BrowseComp-Plus использование Nemotron 3 Embed привело к снижению стоимости токенов для модели-агента Nemotron 3 Ultra. Меньше шума в контексте — меньше вычислений на финальном этапе генерации.
Технические характеристики моделей
Линейка включает три модели, закрывающие разные сценарии: от максимальной точности до ультра-высокой пропускной способности. Все модели поддерживают контекстное окно 32k токенов, что критично для длинных документов и истории диалогов.
| Модель | Роль | Ключевые метрики / Особенности |
|---|---|---|
| Nemotron-3-Embed-8B-BF16 | Флагман качества | #1 в RTEB (78.5%), MMTEB 75.5%. Для высокостakes RAG. |
| Nemotron-3-Embed-1B-BF16 | Стандарт эффективности | RTEB 72.4%. Ошибка снижена на 27% по сравнению с предшественником (1B v2). |
| Nemotron-3-Embed-1B-NVFP4 | Hardware-ускорение | Оптимизация под Blackwell. Пропускная способность до 2x выше BF16. Потеря точности < 1%. |
Инфраструктурные преимущества: NVFP4 и NIM
Модель 1B-NVFP4 использует нативное ускорение 4-битной квантизации на архитектурах NVIDIA Blackwell. Это позволяет сократить потребление памяти и увеличить пропускную способность до 2 раз по сравнению с версией BF16, сохраняя более 99% точности. Для развертывания NVIDIA выпустила оптимизированный микросервис NIM на базе Rust, который на GPU GB200 и RTX PRO 6000 показывает производительность, сопоставимую или превосходящую стандартные чекпоинты vLLM.
Открытость и интеграция
Модели доступны на Hugging Face с открытыми весами, датасетами и рецептами для дообучения (fine-tuning) и дистилляции через NVIDIA NeMo AutoModel. Поддержка vLLM и интеграция в AI Cloud партнеров обеспечивают готовность к production-использованию «день в день» (Day-0).
Источник: Hugging Face blog ↗
