Релиз модели23 сентября 2026 г., 17:30 МСК🤖 Auto

NVIDIA Nemotron 3: 100M параметров и лидер VoiceArena в диаризации

NVIDIA представила модель Nemotron 3 Diarization с 100 млн параметров, занявшую 1-е место в бенчмарке VoiceArena с ошибкой 14.72%. Модель поддерживает до 8 спикеров и потоковую обработку.

Баннер новости 8104

Лидер бенчмарка и ключевые характеристики

NVIDIA выпустила модель Nemotron 3 Diarization — open-weight решение с 100 миллионами параметров, предназначенное для определения того, кто говорит и когда. Модель заняла 1-е место в рейтинге VoiceArena's Diarization-Bench, опередив 12 других систем. Ключевая метрика эффективности — Diarization Error Rate (DER) на уровне 14.72% с учетом перекрывающейся речи.

В отличие от предыдущих решений, таких как Streaming Sortformer, поддерживавших только 4 спикеров, новая архитектура масштабируется до 8 одновременных каналов. Это критически важно для корпоративных встреч, подкастов и колл-центров, где часто участвует несколько участников.

Техническая архитектура и работа с потоком

Модель использует подход Sortformer, упорядочивая спикеров по времени их первого появления. Это решает проблему «перестановки» спикеров при обработке чанков (кусков аудио) в реальном времени. Для обеспечения стабильности в потоковом режиме (streaming) применяются два механизма памяти:

  • AOSC (Arrival-Order Speaker Cache): кэш, сохраняющий информацию о спикерах, упорядоченную по времени их появления.
  • FIFO Queue: очередь «первым пришел — первым ушел» для хранения контекста последних кадров.

Модель принимает аудио 16 кГц, преобразует его в Mel-спектрограммы (кадры по 80 мс) и обрабатывает через 31-слойный Transformer с позиционными эмбеддингами RoPE. Выходом является тензор вероятностей активности спикеров, который затем постобработкой конвертируется в временные метки.

Баланс между задержкой и точностью

Одна из главных особенностей Nemotron 3 — гибкая настройка задержки (latency). Модель поддерживает несколько режимов входного буфера, позволяя разработчикам выбирать компромисс между скоростью отклика и точностью:

Режим задержки (Input Buffer) Описание Применение
30.4 секунды Высокая точность, офлайн-стиль Анализ записанных встреч, подкастов
1.04 секунды Баланс Потоковые трансляции, запись звонков
0.64 секунды Низкая задержка Интерактивные голосовые агенты
0.32 секунды Минимальная рекомендованная задержка Реальное время (real-time)

Хотя технически возможен буфер 80 мс, NVIDIA рекомендует не опускаться ниже 0.32 секунды для сохранения качества. Важно отметить, что модель выдает анонимные ID спикеров (speaker_1, speaker_2), а не имена. Для идентификации конкретных людей требуется интеграция с моделями верификации спикеров или метаданными встреч.

Влияние данных David AI на качество

Значительный прирост точности был достигнут за счет использования лицензированных данных от компании David AI. Добавление мультиязычных смесей (21 язык) и аннотированных реальных разговоров снизило Compound DER с 11.19% до 10.42% (абсолютное улучшение на 0.77 п.п.). Это демонстрирует важность качественных размеченных данных для обучения моделей, работающих в сложных акустических условиях.

Почему это важно для разработчиков

Диаризация — это не распознавание речи (ASR), а определение активности спикеров. Без точной диаризации транскрипты встреч теряют смысл: невозможно понять, кто принял решение, кто возражал или кто перебил. Nemotron 3 позволяет создавать end-to-end пайплайны, где timestamps от диаризации объединяются с текстом от ASR, создавая структурированные, атрибутивные стенограммы. Открытые веса модели (100M параметров) делают её легкой для развертывания на edge-устройствах и в облачных инференс-сервисах без необходимости использования тяжелых GPU-кластеров.

Источник: Hugging Face blog ↗