Прорыв в распознавании говорящих
NVIDIA представила Nemotron 3 Diarization — модель с 100 миллионами параметров, решающую ключевую проблему аудиоаналитики: определение того, кто и когда говорил. В отличие от стандартного распознавания речи (ASR), которое выдает текст без атрибуции, эта модель генерирует временные метки для каждого участника, что критично для суммаризации встреч, аналитики звонков и работы голосовых агентов.
Главное отличие от предыдущей модели NVIDIA (Streaming Sortformer) — поддержка до 8 одновременных говорящих (ранее было 4) и способность корректно обрабатывать перекрывающуюся речь. Модель работает в режиме реального времени и офлайн, используя единый чекпоинт.
Архитектура и производительность
Модель принимает аудио 16 кГц (форматы .wav, .flac, .opus, .mp3), преобразует его в Mel-спектрограммы и обрабатывает через 31-слойный Transformer с ротационными позиционными эмбеддингами (RoPE). Архитектура Sortformer позволяет стабильно идентифицировать говорящих в потоке, не перепутывая их каналы при обработке чанков.
В независимом тестировании Voice Arena Diarization-Bench (139 английских разговоров, ~22 часа) Nemotron 3 Diarization показала результат 14.72% DER (Diarization Error Rate), заняв 1-е место среди 12 систем. Это на ~24% лучше, чем у следующей по рейтингу системы (19.3%).
Сравнение с предыдущим поколением
При сравнении с базовой моделью Streaming Sortformer (4 спикера, задержка 1.04 с) Nemotron 3 демонстрирует значительный прирост точности и скорости. Ниже приведены ключевые метрики производительности на GPU NVIDIA RTX PRO 5000 (BF16, torch.compile):
| Конфигурация | Буферная задержка | DIHARD III DER | Пропускная способность (RTFx) |
|---|---|---|---|
| Offline style | 30.4 s | 12.73% | 15,113× |
| Low latency | 1.04 s | 13.18% | 865× |
| Very low latency | 0.64 s | 13.28% | 579× |
| Ultra-low latency | 0.32 s | 13.55% | 292× |
Относительное снижение ошибки (DER) по сравнению с 4-спикерной базой варьируется от 9.0% до 65.2% в зависимости от набора данных, в среднем составляя 41.0%.
Данные для обучения и лицензия
Модель обучена на ~10 000 часах реальных разговоров и 82 611 часах симулированных многоголосых смесей. Особую ценность добавили лицензированные данные от David AI (21 язык), которые снизили составную ошибку с 11.19% до 10.42%.
Весы модели опубликованы под лицензией OpenMDW License 1.1, разрешающей коммерческое использование. Модель совместима с NVIDIA NeMo и работает на GPU архитектур Ampere, Ada Lovelace, Hopper и Blackwell.
Ограничения и внедрение
Модель не рекомендуется для записей с более чем 8 говорящими, а также для условий с сильным шумом, эхом или удаленным захватом звука. Для интеграции требуется Python 3.12+ и пакет nemo-toolkit[asr]. Для получения текста в связке с диаризацией NVIDIA рекомендует использовать модель Parakeet TDT 0.6B v3.
Источник: MarkTechPost ↗
