Главная/Блог/Гайд/NVIDIA Nemotron 3 Embed: Новый стандарт…
Гайд4 мин чтения · 17 июля 2026 г.

NVIDIA Nemotron 3 Embed: Новый стандарт для RAG и агентов

Разбираем архитектуру, производительность и практическое применение новых моделей эмбеддингов NVIDIA Nemotron 3, которые занимают первые строчки в бенчмарках.

NVIDIA Nemotron 3 Embed: Новый стандарт для RAG и агентов

В мире искусственного интеллекта, где гонка за параметрами часто затмевает важность эффективности, NVIDIA делает шаг, который может изменить правила игры для разработчиков, работающих с Retrieval-Augmented Generation (RAG) и автономными агентами. Компания представила коллекцию моделей Nemotron 3 Embed, открытую для использования, которая не просто предлагает новые веса, а переосмысливает подход к индексации и поиску информации. Эти модели решают критическую задачу: они определяют, какие именно фрагменты данных увидят агенты при поиске ответов. В эпоху, когда контекстное окно LLM расширяется, но стоимость вычислений и задержки остаются барьерами, эффективное сжатие и точность эмбеддингов становятся ключевыми факторами успеха.

Новая линейка Nemotron 3 включает три проверенных чекпоинта, каждый из которых оптимизирован под свои задачи: от максимальной точности до высокой пропускной способности на архитектуре Blackwell. Все модели поддерживают контекстное окно до 32 768 токенов, что позволяет обрабатывать длинные документы без агрессивного дробления, сохраняя семантическую целостность. В этой статье мы подробно разберем архитектуру моделей, результаты бенчмарков, методы сжатия и практические примеры внедрения в production-среды.

01Что такое Nemotron 3 Embed и почему это важно?

Модели эмбеддингов (embedding models) — это «глаза» современных AI-агентов. Прежде чем большая языковая модель (LLM) сможет сформулировать ответ, система должна найти релевантную информацию в базе знаний. Именно эмбеддинг-модель преобразует текст в векторы, позволяя сравнивать семантическую близость запроса пользователя и документов в базе. Если этот этап выполнен неточно, даже самая мощная LLM выдаст неверный ответ, так как она просто не увидит нужного контекста.

NVIDIA Nemotron 3 Embed нацелена на решение проблем производственного масштаба. Она поддерживает многоязычный поиск (34 языка), извлечение кода и управление памятью агентов. Важно отметить, что базовыми архитектурами для этих моделей служат модели Mistral. Чекпоинт 8B построен на базе Ministral-3-8B-Instruct-2512, а оба варианта 1B используют Ministral-3-3B-Instruct-2512. Это обеспечивает сильную лингвистическую базу и способность к обобщению.

NVIDIA Nemotron 3 Embed: Новый стандарт для RAG и агентов

Все три модели являются трансформерными энкодерами, обученными с использованием двунаправленной маски внимания (bidirectional attention masking). Это означает, что при кодировании токена модель учитывает как предыдущий, так и следующий контекст, что значительно повышает точность по сравнению с односторонними моделями. Итоговый эмбеддинг формируется путем усреднения пулинга (average pooling) по уровням токенов. Максимальная длина последовательности для всех чекпоинтов составляет 32 768 токенов, что является современным стандартом для работы с длинными документами.

02Производительность: Лидерство в RTEB

Главным показателем успеха новой линейки стало первое место в общем зачете Retrieval Embedding Benchmark (RTEB) по состоянию на 17 июля 2026 года. Модель Nemotron-3-Embed-8B-BF16 показала средний результат NDCG@10 на уровне 78.46. RTEB оценивает модели по 16 публичным задачам, охватывающим различные сценарии поиска, включая текстовый поиск, мультимодальные запросы и специализированные домены.

Давайте посмотрим на сравнительные данные, чтобы понять масштаб преимуществ:

NVIDIA Nemotron 3 Embed: Новый стандарт для RAG и агентов
Модель Параметры Размер эмбеддинга RTEB (Avg NDCG@10) ViDoRe-V3 text MMTEB (Retrieval)
Nemotron-3-Embed-8B-BF16 ~8B 4096 78.46 60.60 75.45
Nemotron-3-Embed-1B-BF16 1.14B 2048 72.38 57.74 71.04
Nemotron-3-Embed-1B-NVFP4 1.14B 2048 72.00 - -
llama-nemotron-embed-vl-1b-v2 - - 61.98 52.54 59.71
llama-nemotron-embed-1b-v2 - - 60.47 52.10 59.58

Обратите внимание на разрыв между моделями. Версия 1B демонстрирует прирост в 10.4 балла RTEB по сравнению с предыдущим поколением llama-nemotron-embed-vl-1b-v2. Это колоссальное улучшение для модели такого малого размера. Кроме того, квантованная версия NVFP4 теряет всего 0.38 балла по сравнению с родительской моделью BF16, сохраняя 99.5% точности, что делает её идеальной для высоконагруженных систем.

03Как была создана модель 1B: Магия сжатия

Высокие результаты модели 1B не являются результатом простого уменьшения размера сети. Это итог сложного конвейера сжатия, включающего прунинг (удаление неважных связей) и дистилляцию знаний. Родительской моделью для 1B чекпоинтов выступала nemotron-3-embed-3b.

Процесс состоял из двух итераций. На первом этапе 3B-модель была прунена до 2B с использованием инструмента NVIDIA ModelOpt mcore_minitron Neural Architecture Search (NAS). Этот поиск оптимизировал ширину скрытых слоев, размер FFN (feed-forward network), количество голов внимания и глубину сети. Алгоритм выбирал лучший кандидат из топ-10 на Парето-фронте, оценивая их на корпусе из 50 тысяч внутренних данных.

На втором этапе 2B-модель подверглась дистилляции от учителя — дообученной 8B-модели эмбеддинга. Использовалась комбинация потерь косинусового расстояния (COS) и среднеквадратичной ошибки (MSE). Данные для дистилляции были смешаны из многоязычных источников и индустриальных корпусов. Та же процедура была повторена для получения финального чекпоинта 1.14B.

💡
Технически

Источник: MarkTechPost ↗