Релиз модели8 июля 2026 г., 04:16 МСК🤖 Auto

NVIDIA Audex: 30B-модель, сохранившая текстовый интеллект при работе с аудио

NVIDIA выпустила Audex — унифицированную аудио-текстовую LLM на базе архитектуры MoE. Модель решает проблему «налога на мультимодальность», сохраняя уровень текстовых бенчмарков на уровне текстового бэкбона.

Баннер новости 3071

Архитектура и принцип работы

Audex (Nemotron-Labs-Audex-30B-A3B) — это единая модель Mixture-of-Experts (MoE) с 30 млрд параметров, из которых активировано 3 млрд на токен. В основе лежит текстовый бэкбон Nemotron-Cascade-2-30B-A3B (гибрид Mamba-Transformer с 52 слоями и 128 экспертами). Ключевое отличие от конкурентов: аудио входы проецируются в пространство текстовых эмбеддингов, а выходы генерируются как токены. Это позволяет использовать стандартные стеки (Megatron-LM, vLLM) без сложных каскадов или разделения на «мыслителя» и «говорящего».

Модель поддерживает контекст до 1 млн токенов, работает в режимах instruct и thinking, а также генерирует не только речь, но и общие звуковые эффекты (general audio) с частотой 48 кГц.

Решение проблемы регрессии текста

Большинство мультимодальных моделей теряют в текстовых бенчмарках при добавлении аудио/видео. NVIDIA удалось избежать этого, используя двухэтапное обучение: сначала Multi-stage SFT (с заморозкой текстовых эмбеддингов на этапе аудио-разогрева), затем текстовый-only Cascade RL и MOPD. Результат: Audex не только не теряет в качестве, но и превосходит некоторые текстовые аналоги.

Сравнение с конкурентами

Audex демонстрирует выдающиеся результаты в текстовом рассуждении и распознавании речи, превосходя Qwen3.5-35B-A3B и Qwen3-Omni. Ниже приведена сравнительная таблица ключевых метрик:

Бенчмарк Audex 30B-A3B Qwen3.5-35B-A3B Qwen3-Omni-30B-A3B-Thinking
HMMT Feb25 92.2 89.0 60.4
IMO AnswerBench 81.1 74.8 59.9
LiveCodeBench v6 85.3 74.6 59.2
ArenaHard v2 81.6 65.4 55.1
OpenASR (WER, ниже лучше) 6.82 8.00

В задачах аудио-понимания Audex лидирует на MMAU (75.6) и Audio Entailment (95.0), но уступает лидерам в MMAR и MMSU. При этом она остается одной из немногих открытых моделей, способных генерировать сложные звуковые сцены (не только речь).

Практическое применение и ограничения

Модель подходит для мультиязычных колл-центров (транскрипция и перевод в реальном времени), инструментов доступности (TTS с WER 1.70 на Seed-TTS-Eval) и саунд-дизайна. Однако лицензия NVIDIA OneWay Noncommercial License запрещает коммерческое использование. Также отмечено, что speech-to-speech работает каскадно, а не в режиме full-duplex, а обучение RL пока ограничено текстовыми данными.

Бенчмарки

БенчмаркAudex 30B-A3BNemotron-Cascade-2-30B-A3B (backbone)Qwen3-Omni-30B-A3B-ThinkingQwen3.5-35B-A3BStep-Audio-R1.1-33B
MMLU-Redux86.4%86.3%
IMO AnswerBench81.1%59.9%74.8%
LiveCodeBench v685.3%59.2%74.6%
ArenaHard v281.6%55.1%65.4%
MMAU75.6%75.4%73.6%
Audio Entailment95%61.6%61.6%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗