В мире искусственного интеллекта существует давняя проблема, которую исследователи называют «налогом на мультимодальность». Когда лаборатории добавляют к языковым моделям возможности работы с изображением или звуком, текстовые бенчмарки часто показывают снижение. Это происходит потому, что модель пытается балансировать между разными типами данных, и в итоге страдает глубина понимания текста. NVIDIA, один из лидеров в области вычислительных мощностей для ИИ, предлагает решение этой проблемы с выходом модели Audex (Nemotron-Labs-Audex-30B-A3B). Это унифицированная аудио-текстовая большая языковая модель, которая не только понимает и генерирует речь и звуки, но и сохраняет интеллектуальный потенциал своего текстового «хребта».
В отличие от многих конкурентов, которые создают сложные каскады из нескольких моделей для каждой задачи, Audex использует единый подход. Модель основана на архитектуре Mixture-of-Experts (MoE) и способна обрабатывать аудио как входные, так и выходные данные, treating их как обычные текстовые токены. Это упрощает развертывание и позволяет использовать стандартные стеки для обучения и инференса, такие как Megatron-LM и vLLM. В этой статье мы подробно разберем, как работает Audex, почему она важна для индустрии и как ее можно использовать в реальных проектах.
01Архитектура Audex: Простота как ключ к успеху
В основе Audex лежит модель Nemotron-Cascade-2-30B-A3B, которая изначально была разработана только для работы с текстом. Это гибридная модель, сочетающая в себе архитектуры Mamba и Transformer, состоящая из 52 слоев. Общая количество параметров составляет 30 миллиардов, но благодаря механизму Mixture-of-Experts (MoE), при обработке каждого токена активируется только 3 миллиарда параметров. Это обеспечивает высокую эффективность вычислений без потери качества.
Ключевая инновация Audex заключается в том, как она обрабатывает аудио. Вместо того чтобы создавать отдельные модули для распознавания и синтеза речи, исследователи NVIDIA спроектировали систему, где аудио вводится в пространство текстовых эмбеддингов. Проще говоря, звуковые волны преобразуются в токены, которые модель обрабатывает так же, как слова в предложении. Это означает, что нет разделения на «мыслителя» и «говорящего», как это часто бывает в других мультимодальных системах. Текстовые токены и квантованные аудио-токены обрабатываются унифицированно.
Такой подход позволяет Audex работать в стандартных инфраструктурах. Модель поддерживает контекстное окно до 1 миллиона токенов, что открывает возможности для анализа очень длинных аудиозаписей или текстов. Поддерживаются как режим инструкций (instruct mode), так и режим размышлений (thinking mode), что делает модель гибкой для различных сценариев использования.
Три компонента унифицированного дизайна
Вокруг текстового ядра LLM в Audex построены три основных компонента, которые обеспечивают работу с аудио:
- Аудиоэнкодер: Для кодирования звука используется AF-Whisper, основанная на архитектуре Whisper Large-v3. Она обрабатывает входной сигнал с частотой 16 кГц, обеспечивая качественное извлечение признаков.
- Адаптеры MLP: Двухслойные многослойные перцептроны (MLP) отображают извлеченные аудио-признаки в размерность модели, позволяя текстовому ядру «понимать» звуковые данные.
- Расширенный словарь: Оригинальный словарь модели, состоящий из 131 072 токенов, был расширен до 205 312 токенов. Новые токены предназначены для дискретного представления аудио-выхода.
Для генерации аудио используются два разных кодека. Для речи применяется X-Codec2 со скоростью 50 токенов в секунду, использующий однослойное конечное скалярное квантование (FSQ) с кодовой книгой размером 65 536. Для неречевых звуков используется X-Codec со скоростью 200 токенов в секунду, который применяет четыре слоя остаточного векторного квантования (RVQ). Это позволяет выделять больший бюджет токенов для сложных звуков, таких как музыка или шумы окружающей среды, обеспечивая более высокое качество генерации.
02Обучение без предварительной подготовки на аудио
Одним из самых впечатляющих аспектов Audex является то, что ей не требуется предварительное обучение на аудио-данных. Процесс обучения начинается с контрольной точки SFT (Supervised Fine-Tuning), обученной исключительно на тексте. Затем возможности добавляются поэтапно, что позволяет сохранить текстовые навыки модели.

Исследователи использовали многоэтапную программу SFT, которая включает следующие шаги:
- Текстовый SFT: Базовое дообучение на текстовых данных.
- Аудио-разогрев (Audio Warmup): На этом этапе эмбеддинги текстовых токенов замораживаются. Это критически важно, так как эксперименты показали, что разморозка эмбеддингов на ранних этапах приводит к деградации качества текста.
- Генерация аудио: Модель учится создавать звуковые токены.
- Понимание аудио: Модель учится интерпретировать входные звуковые данные.
Команда NVIDIA также тестировала одноэтапный рецепт, где все данные смешивались сразу. Однако этот подход привел к нарушению способности модели к поиску информации в длинном контексте (NIAH). Многоэтапное обучение позволило избежать этой проблемы и стало основным методом.
После этапа SFT применяется текстовый Cascade RL (Reinforcement Learning) и многодоменная дистилляция on-policy (MOPD). Интересно, что после применения только текстового RL аудио-задачи показали незначительную регрессию или ее отсутствие, а текстовые баллы даже улучшились. Это доказывает эффективность подхода «текст-первым».
03Производительность и бенчмарки
Главный вопрос, который волнует разработчиков: не потеряла ли модель свои текстовые способности? Ответ — нет. Audex демонстрирует результаты, сопоставимые с ее текстовым «хребтом» Nemotron-Cascade-2-30B-A3B. На бенчмарке MMLU-Redux Audex набирает 86.4 против 86.3 у базовой модели. Более того, на IMO AnswerBench Audex показывает лучший результат — 81.1 против 79.3 у бэкбона.
Сравнение с другими открытыми моделями показывает преимущество Audex. Например, она превосходит Qwen3.5-35B-A3B в нескольких задачах на рассуждение, выравнивание и следование инструкциям. В то же время, конкурент Qwen3-Omni-30B-A3B-Thinking показывает значительное падение в задачах на рассуждение по сравнению со своим собственным бэкбонном, что подтверждает тезис о «налоге на мультимодальность».
| Бенчмарк | Audex 30B-A3B | Qwen3.5-35B-A3B | Qwen3-Omni-30B-A3B-Thinking |
|---|---|---|---|
| HMMT Feb25 | 92.2 | 89.0 | 60.4 |
| IMO AnswerBench | 81.1 | 74.8 | 59.9 |
| LiveCodeBench v6 | 85.3 | 74.6 | 59.2 |
| ArenaHard v2 | 81.6 | 65.4 | 55.1 |
| IFBench (prompt) | 77.8 | 70.2 | 52.4 |
В области распознавания речи Audex также лидирует среди открытых моделей. На лидерборде OpenASR средняя ошибка в словах (WER) составляет 6.82, что лучше, чем у Step-Audio-R1.1-33B (7.91) и Qwen3-Omni-30B-A3B-Thinking (8.00).
Однако в задачах общего понимания аудио картина смешанная. Audex лидирует на MMAU и Audio Entailment, но уступает сильным аудио-LLM на MMAR и MMSU. Тем не менее, Audex является одной из немногих открытых моделей, способных генерировать общие звуки (не только речь), что открывает новые возможности для креативных индустрий.

04Практическое применение: Примеры использования
Давайте рассмотрим, как Audex может быть использована в реальных сценариях:
1. Многоголосные колл-центры
Представьте колл-центр, обслуживающий клиентов из разных стран. Audex может транскрибировать звонок на немецком языке и мгновенно перевести его на английский. Вывод модели включает исходный язык, транскрипцию и перевод, что упрощает работу операторов и снижает барьеры для международного общения.
2. Инструменты доступности
Разработчики могут интегрировать Audex в приложения для чтения с фиксированным голосом. Низкая ошибка в словах (WER) в 1.70 на тесте Seed-TTS-Eval означает, что синтезированная речь будет звучать естественно и точно, что критически важно для пользователей с нарушениями зрения.
3. Звуковой дизайн и прототипирование
Для создателей контента Audex предлагает возможность генерации звуков по текстовому описанию. Запрос «птицы щебечут в лесу» сгенерирует 10-секундный клип. Использование улучшенного VAE позволяет получать звук с частотой 48 кГц, что обеспечивает высокое качество для профессионального использования.
4. Голосовые ассистенты
Хотя распознавание и синтез речи выполняются каскадно, все этапы обслуживаются одной контрольной точкой. Это упрощает архитектуру системы. Audex набирает 90.0 на BigBenchAudio, что свидетельствует о хорошем качестве генерации сложных звуков.
05Быстрый старт: Как запустить Audex
Audex следует шаблону ChatML. Для запуска рекомендуется использовать vLLM версии 0.20.0. Для декодирования аудио необходимо установить дополнительные пакеты (audio extras).
Формат ввода для понимания аудио, распознавания речи и перевода одинаков. Метка
{
"id": "sample_0",
"sound": "/path/to/audio_0.wav",
"conversations": [
{
"from": "human",
"value": "\nDescribe the audio in detail."
},
{
"from": "gpt",
"value": "N/A"
}
]
} Для запуска можно использовать следующий скрипт:

python3 -m pip install "vllm[all]"
python inference_scripts_vllm/audioqa_scripts/run_audioqa_vllm.py \
--model_path "$(pwd)/checkpoint_folder_full" \
--input_json inputs.json \
--output_jsonl results.jsonl \
--tensor_parallel_size 1Исследователи рекомендуют использовать параметры top_p=0.9 и temperature=0.7 для задач понимания аудио. Для распознавания и перевода лучше использовать жадную выборку (greedy sampling). Для задач генерации требуется guidance, классифицируемый как «без классификатора» (classifier-free guidance).
06Сильные и слабые стороны
Сильные стороны
- Минимальная или отсутствующая регрессия текстовых показателей по сравнению с текстовым бэкбонном.
- Единая унифицированная модель, совместимая с Megatron-LM и vLLM.
- Одна из самых сильных открытых моделей, способных генерировать общие звуки (не только речь).
- Превосходит Qwen3.5-35B-A3B в нескольких задачах на рассуждение и выравнивание.
Слабые стороны
- Лицензия ограничивает коммерческое использование.
- В задачах общего понимания аудио есть пробелы на MMAR и MMSU по сравнению с топ-аудио LLM.
- Распознавание речи в речь (speech-to-speech) выполняется каскадно, а не в режиме full-duplex.
- Обучение с подкреплением (RL) применяется только к тексту; аудио-текстовый RL является задачей будущего.
07Что это значит на практике
Выход Audex знаменует собой важный шаг в развитии мультимодального ИИ. До сих пор разработчикам приходилось выбирать между качеством текста и качеством аудио, или использовать сложные системы из нескольких моделей. Audex доказывает, что можно объединить эти возможности в одной модели, сохранив при этом высокую интеллектуальную планку.
Для разработчиков из России это означает возможность локального запуска мощной модели для обработки аудио и текста, что особенно актуально в условиях ограничений на доступ к облачным сервисам. Однако необходимо учитывать лицензионные ограничения. Для исследовательских целей, образовательных проектов и внутренних корпоративных задач Audex представляет собой отличный инструмент. Генерация общих звуков открывает новые горизонты для создания иммерсивных сред, игр и медиа-контента.
В будущем мы можем ожидать появления коммерческих версий Audex и моделей, которые решат текущие ограничения в области аудио-текстового RL и full-duplex взаимодействия. Но уже сейчас Audex устанавливает новый стандарт для открытых унифицированных аудио-текстовых моделей.
Источник: MarkTechPost ↗
