Архитектура и принцип работы
Audex (Nemotron-Labs-Audex-30B-A3B) — это единая модель Mixture-of-Experts (MoE) с 30 млрд параметров, из которых активировано 3 млрд на токен. В основе лежит текстовый бэкбон Nemotron-Cascade-2-30B-A3B (гибрид Mamba-Transformer с 52 слоями и 128 экспертами). Ключевое отличие от конкурентов: аудио входы проецируются в пространство текстовых эмбеддингов, а выходы генерируются как токены. Это позволяет использовать стандартные стеки (Megatron-LM, vLLM) без сложных каскадов или разделения на «мыслителя» и «говорящего».
Модель поддерживает контекст до 1 млн токенов, работает в режимах instruct и thinking, а также генерирует не только речь, но и общие звуковые эффекты (general audio) с частотой 48 кГц.
Решение проблемы регрессии текста
Большинство мультимодальных моделей теряют в текстовых бенчмарках при добавлении аудио/видео. NVIDIA удалось избежать этого, используя двухэтапное обучение: сначала Multi-stage SFT (с заморозкой текстовых эмбеддингов на этапе аудио-разогрева), затем текстовый-only Cascade RL и MOPD. Результат: Audex не только не теряет в качестве, но и превосходит некоторые текстовые аналоги.
Сравнение с конкурентами
Audex демонстрирует выдающиеся результаты в текстовом рассуждении и распознавании речи, превосходя Qwen3.5-35B-A3B и Qwen3-Omni. Ниже приведена сравнительная таблица ключевых метрик:
| Бенчмарк | Audex 30B-A3B | Qwen3.5-35B-A3B | Qwen3-Omni-30B-A3B-Thinking |
|---|---|---|---|
| HMMT Feb25 | 92.2 | 89.0 | 60.4 |
| IMO AnswerBench | 81.1 | 74.8 | 59.9 |
| LiveCodeBench v6 | 85.3 | 74.6 | 59.2 |
| ArenaHard v2 | 81.6 | 65.4 | 55.1 |
| OpenASR (WER, ниже лучше) | 6.82 | — | 8.00 |
В задачах аудио-понимания Audex лидирует на MMAU (75.6) и Audio Entailment (95.0), но уступает лидерам в MMAR и MMSU. При этом она остается одной из немногих открытых моделей, способных генерировать сложные звуковые сцены (не только речь).
Практическое применение и ограничения
Модель подходит для мультиязычных колл-центров (транскрипция и перевод в реальном времени), инструментов доступности (TTS с WER 1.70 на Seed-TTS-Eval) и саунд-дизайна. Однако лицензия NVIDIA OneWay Noncommercial License запрещает коммерческое использование. Также отмечено, что speech-to-speech работает каскадно, а не в режиме full-duplex, а обучение RL пока ограничено текстовыми данными.
Бенчмарки
| Бенчмарк | Audex 30B-A3B | Nemotron-Cascade-2-30B-A3B (backbone) | Qwen3-Omni-30B-A3B-Thinking | Qwen3.5-35B-A3B | Step-Audio-R1.1-33B |
|---|---|---|---|---|---|
| MMLU-Redux | 86.4% | 86.3% | — | — | — |
| IMO AnswerBench | 81.1% | — | 59.9% | 74.8% | — |
| LiveCodeBench v6 | 85.3% | — | 59.2% | 74.6% | — |
| ArenaHard v2 | 81.6% | — | 55.1% | 65.4% | — |
| MMAU | 75.6% | — | 75.4% | — | 73.6% |
| Audio Entailment | 95% | — | 61.6% | — | 61.6% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
