В мире искусственного интеллекта, где гонка за параметрами часто затмевает важность эффективности, NVIDIA делает шаг, который может изменить правила игры для разработчиков, работающих с Retrieval-Augmented Generation (RAG) и автономными агентами. Компания представила коллекцию моделей Nemotron 3 Embed, открытую для использования, которая не просто предлагает новые веса, а переосмысливает подход к индексации и поиску информации. Эти модели решают критическую задачу: они определяют, какие именно фрагменты данных увидят агенты при поиске ответов. В эпоху, когда контекстное окно LLM расширяется, но стоимость вычислений и задержки остаются барьерами, эффективное сжатие и точность эмбеддингов становятся ключевыми факторами успеха.
Новая линейка Nemotron 3 включает три проверенных чекпоинта, каждый из которых оптимизирован под свои задачи: от максимальной точности до высокой пропускной способности на архитектуре Blackwell. Все модели поддерживают контекстное окно до 32 768 токенов, что позволяет обрабатывать длинные документы без агрессивного дробления, сохраняя семантическую целостность. В этой статье мы подробно разберем архитектуру моделей, результаты бенчмарков, методы сжатия и практические примеры внедрения в production-среды.
01Что такое Nemotron 3 Embed и почему это важно?
Модели эмбеддингов (embedding models) — это «глаза» современных AI-агентов. Прежде чем большая языковая модель (LLM) сможет сформулировать ответ, система должна найти релевантную информацию в базе знаний. Именно эмбеддинг-модель преобразует текст в векторы, позволяя сравнивать семантическую близость запроса пользователя и документов в базе. Если этот этап выполнен неточно, даже самая мощная LLM выдаст неверный ответ, так как она просто не увидит нужного контекста.
NVIDIA Nemotron 3 Embed нацелена на решение проблем производственного масштаба. Она поддерживает многоязычный поиск (34 языка), извлечение кода и управление памятью агентов. Важно отметить, что базовыми архитектурами для этих моделей служат модели Mistral. Чекпоинт 8B построен на базе Ministral-3-8B-Instruct-2512, а оба варианта 1B используют Ministral-3-3B-Instruct-2512. Это обеспечивает сильную лингвистическую базу и способность к обобщению.

Все три модели являются трансформерными энкодерами, обученными с использованием двунаправленной маски внимания (bidirectional attention masking). Это означает, что при кодировании токена модель учитывает как предыдущий, так и следующий контекст, что значительно повышает точность по сравнению с односторонними моделями. Итоговый эмбеддинг формируется путем усреднения пулинга (average pooling) по уровням токенов. Максимальная длина последовательности для всех чекпоинтов составляет 32 768 токенов, что является современным стандартом для работы с длинными документами.
02Производительность: Лидерство в RTEB
Главным показателем успеха новой линейки стало первое место в общем зачете Retrieval Embedding Benchmark (RTEB) по состоянию на 17 июля 2026 года. Модель Nemotron-3-Embed-8B-BF16 показала средний результат NDCG@10 на уровне 78.46. RTEB оценивает модели по 16 публичным задачам, охватывающим различные сценарии поиска, включая текстовый поиск, мультимодальные запросы и специализированные домены.
Давайте посмотрим на сравнительные данные, чтобы понять масштаб преимуществ:

| Модель | Параметры | Размер эмбеддинга | RTEB (Avg NDCG@10) | ViDoRe-V3 text | MMTEB (Retrieval) |
|---|---|---|---|---|---|
| Nemotron-3-Embed-8B-BF16 | ~8B | 4096 | 78.46 | 60.60 | 75.45 |
| Nemotron-3-Embed-1B-BF16 | 1.14B | 2048 | 72.38 | 57.74 | 71.04 |
| Nemotron-3-Embed-1B-NVFP4 | 1.14B | 2048 | 72.00 | - | - |
| llama-nemotron-embed-vl-1b-v2 | - | - | 61.98 | 52.54 | 59.71 |
| llama-nemotron-embed-1b-v2 | - | - | 60.47 | 52.10 | 59.58 |
Обратите внимание на разрыв между моделями. Версия 1B демонстрирует прирост в 10.4 балла RTEB по сравнению с предыдущим поколением llama-nemotron-embed-vl-1b-v2. Это колоссальное улучшение для модели такого малого размера. Кроме того, квантованная версия NVFP4 теряет всего 0.38 балла по сравнению с родительской моделью BF16, сохраняя 99.5% точности, что делает её идеальной для высоконагруженных систем.
03Как была создана модель 1B: Магия сжатия
Высокие результаты модели 1B не являются результатом простого уменьшения размера сети. Это итог сложного конвейера сжатия, включающего прунинг (удаление неважных связей) и дистилляцию знаний. Родительской моделью для 1B чекпоинтов выступала nemotron-3-embed-3b.
Процесс состоял из двух итераций. На первом этапе 3B-модель была прунена до 2B с использованием инструмента NVIDIA ModelOpt mcore_minitron Neural Architecture Search (NAS). Этот поиск оптимизировал ширину скрытых слоев, размер FFN (feed-forward network), количество голов внимания и глубину сети. Алгоритм выбирал лучший кандидат из топ-10 на Парето-фронте, оценивая их на корпусе из 50 тысяч внутренних данных.
На втором этапе 2B-модель подверглась дистилляции от учителя — дообученной 8B-модели эмбеддинга. Использовалась комбинация потерь косинусового расстояния (COS) и среднеквадратичной ошибки (MSE). Данные для дистилляции были смешаны из многоязычных источников и индустриальных корпусов. Та же процедура была повторена для получения финального чекпоинта 1.14B.
Источник: MarkTechPost ↗
