Релиз модели23 сентября 2026 г., 22:19 МСК🤖 Auto

NVIDIA Nemotron 3 Diarization: 8 голосов, 100M параметров и лидер Voice Arena

NVIDIA выпустила модель диаризации Nemotron 3 с открытыми весами, способную отслеживать до 8 говорящих одновременно. Модель заняла 1-е место в бенчмарке Voice Arena, снизив ошибку на 24% по сравнению с лидерами.

Баннер новости 8127

Прорыв в распознавании говорящих

NVIDIA представила Nemotron 3 Diarization — модель с 100 миллионами параметров, решающую ключевую проблему аудиоаналитики: определение того, кто и когда говорил. В отличие от стандартного распознавания речи (ASR), которое выдает текст без атрибуции, эта модель генерирует временные метки для каждого участника, что критично для суммаризации встреч, аналитики звонков и работы голосовых агентов.

Главное отличие от предыдущей модели NVIDIA (Streaming Sortformer) — поддержка до 8 одновременных говорящих (ранее было 4) и способность корректно обрабатывать перекрывающуюся речь. Модель работает в режиме реального времени и офлайн, используя единый чекпоинт.

Архитектура и производительность

Модель принимает аудио 16 кГц (форматы .wav, .flac, .opus, .mp3), преобразует его в Mel-спектрограммы и обрабатывает через 31-слойный Transformer с ротационными позиционными эмбеддингами (RoPE). Архитектура Sortformer позволяет стабильно идентифицировать говорящих в потоке, не перепутывая их каналы при обработке чанков.

В независимом тестировании Voice Arena Diarization-Bench (139 английских разговоров, ~22 часа) Nemotron 3 Diarization показала результат 14.72% DER (Diarization Error Rate), заняв 1-е место среди 12 систем. Это на ~24% лучше, чем у следующей по рейтингу системы (19.3%).

Сравнение с предыдущим поколением

При сравнении с базовой моделью Streaming Sortformer (4 спикера, задержка 1.04 с) Nemotron 3 демонстрирует значительный прирост точности и скорости. Ниже приведены ключевые метрики производительности на GPU NVIDIA RTX PRO 5000 (BF16, torch.compile):

Конфигурация Буферная задержка DIHARD III DER Пропускная способность (RTFx)
Offline style 30.4 s 12.73% 15,113×
Low latency 1.04 s 13.18% 865×
Very low latency 0.64 s 13.28% 579×
Ultra-low latency 0.32 s 13.55% 292×

Относительное снижение ошибки (DER) по сравнению с 4-спикерной базой варьируется от 9.0% до 65.2% в зависимости от набора данных, в среднем составляя 41.0%.

Данные для обучения и лицензия

Модель обучена на ~10 000 часах реальных разговоров и 82 611 часах симулированных многоголосых смесей. Особую ценность добавили лицензированные данные от David AI (21 язык), которые снизили составную ошибку с 11.19% до 10.42%.

Весы модели опубликованы под лицензией OpenMDW License 1.1, разрешающей коммерческое использование. Модель совместима с NVIDIA NeMo и работает на GPU архитектур Ampere, Ada Lovelace, Hopper и Blackwell.

Ограничения и внедрение

Модель не рекомендуется для записей с более чем 8 говорящими, а также для условий с сильным шумом, эхом или удаленным захватом звука. Для интеграции требуется Python 3.12+ и пакет nemo-toolkit[asr]. Для получения текста в связке с диаризацией NVIDIA рекомендует использовать модель Parakeet TDT 0.6B v3.

Источник: MarkTechPost ↗