Главная/Блог/Гайд/NVIDIA Audex: Революция в…
Гайд8 мин чтения · 8 июля 2026 г.

NVIDIA Audex: Революция в аудио-текстовых моделях без потери интеллекта

NVIDIA представила Audex — унифицированную LLM, которая понимает и генерирует аудио, не жертвуя качеством текстовых задач. Разбираем архитектуру, обучение и практическое применение.

NVIDIA Audex: Революция в аудио-текстовых моделях без потери интеллекта

В мире искусственного интеллекта существует давняя проблема, которую исследователи называют «налогом на мультимодальность». Когда лаборатории добавляют к языковым моделям возможности работы с изображением или звуком, текстовые бенчмарки часто показывают снижение. Это происходит потому, что модель пытается балансировать между разными типами данных, и в итоге страдает глубина понимания текста. NVIDIA, один из лидеров в области вычислительных мощностей для ИИ, предлагает решение этой проблемы с выходом модели Audex (Nemotron-Labs-Audex-30B-A3B). Это унифицированная аудио-текстовая большая языковая модель, которая не только понимает и генерирует речь и звуки, но и сохраняет интеллектуальный потенциал своего текстового «хребта».

В отличие от многих конкурентов, которые создают сложные каскады из нескольких моделей для каждой задачи, Audex использует единый подход. Модель основана на архитектуре Mixture-of-Experts (MoE) и способна обрабатывать аудио как входные, так и выходные данные, treating их как обычные текстовые токены. Это упрощает развертывание и позволяет использовать стандартные стеки для обучения и инференса, такие как Megatron-LM и vLLM. В этой статье мы подробно разберем, как работает Audex, почему она важна для индустрии и как ее можно использовать в реальных проектах.

01Архитектура Audex: Простота как ключ к успеху

В основе Audex лежит модель Nemotron-Cascade-2-30B-A3B, которая изначально была разработана только для работы с текстом. Это гибридная модель, сочетающая в себе архитектуры Mamba и Transformer, состоящая из 52 слоев. Общая количество параметров составляет 30 миллиардов, но благодаря механизму Mixture-of-Experts (MoE), при обработке каждого токена активируется только 3 миллиарда параметров. Это обеспечивает высокую эффективность вычислений без потери качества.

Ключевая инновация Audex заключается в том, как она обрабатывает аудио. Вместо того чтобы создавать отдельные модули для распознавания и синтеза речи, исследователи NVIDIA спроектировали систему, где аудио вводится в пространство текстовых эмбеддингов. Проще говоря, звуковые волны преобразуются в токены, которые модель обрабатывает так же, как слова в предложении. Это означает, что нет разделения на «мыслителя» и «говорящего», как это часто бывает в других мультимодальных системах. Текстовые токены и квантованные аудио-токены обрабатываются унифицированно.

Такой подход позволяет Audex работать в стандартных инфраструктурах. Модель поддерживает контекстное окно до 1 миллиона токенов, что открывает возможности для анализа очень длинных аудиозаписей или текстов. Поддерживаются как режим инструкций (instruct mode), так и режим размышлений (thinking mode), что делает модель гибкой для различных сценариев использования.

Три компонента унифицированного дизайна

Вокруг текстового ядра LLM в Audex построены три основных компонента, которые обеспечивают работу с аудио:

  1. Аудиоэнкодер: Для кодирования звука используется AF-Whisper, основанная на архитектуре Whisper Large-v3. Она обрабатывает входной сигнал с частотой 16 кГц, обеспечивая качественное извлечение признаков.
  2. Адаптеры MLP: Двухслойные многослойные перцептроны (MLP) отображают извлеченные аудио-признаки в размерность модели, позволяя текстовому ядру «понимать» звуковые данные.
  3. Расширенный словарь: Оригинальный словарь модели, состоящий из 131 072 токенов, был расширен до 205 312 токенов. Новые токены предназначены для дискретного представления аудио-выхода.

Для генерации аудио используются два разных кодека. Для речи применяется X-Codec2 со скоростью 50 токенов в секунду, использующий однослойное конечное скалярное квантование (FSQ) с кодовой книгой размером 65 536. Для неречевых звуков используется X-Codec со скоростью 200 токенов в секунду, который применяет четыре слоя остаточного векторного квантования (RVQ). Это позволяет выделять больший бюджет токенов для сложных звуков, таких как музыка или шумы окружающей среды, обеспечивая более высокое качество генерации.

02Обучение без предварительной подготовки на аудио

Одним из самых впечатляющих аспектов Audex является то, что ей не требуется предварительное обучение на аудио-данных. Процесс обучения начинается с контрольной точки SFT (Supervised Fine-Tuning), обученной исключительно на тексте. Затем возможности добавляются поэтапно, что позволяет сохранить текстовые навыки модели.

NVIDIA Audex: Революция в аудио-текстовых моделях без потери интеллекта

Исследователи использовали многоэтапную программу SFT, которая включает следующие шаги:

  1. Текстовый SFT: Базовое дообучение на текстовых данных.
  2. Аудио-разогрев (Audio Warmup): На этом этапе эмбеддинги текстовых токенов замораживаются. Это критически важно, так как эксперименты показали, что разморозка эмбеддингов на ранних этапах приводит к деградации качества текста.
  3. Генерация аудио: Модель учится создавать звуковые токены.
  4. Понимание аудио: Модель учится интерпретировать входные звуковые данные.

Команда NVIDIA также тестировала одноэтапный рецепт, где все данные смешивались сразу. Однако этот подход привел к нарушению способности модели к поиску информации в длинном контексте (NIAH). Многоэтапное обучение позволило избежать этой проблемы и стало основным методом.

После этапа SFT применяется текстовый Cascade RL (Reinforcement Learning) и многодоменная дистилляция on-policy (MOPD). Интересно, что после применения только текстового RL аудио-задачи показали незначительную регрессию или ее отсутствие, а текстовые баллы даже улучшились. Это доказывает эффективность подхода «текст-первым».

💡
Важный факт. Объем данных для обучения Audex огромен: 157,4 миллиарда аудио-токенов и 320,5 миллиарда текстовых токенов. Задачи охватывают распознавание речи (ASR), аудио-классификацию (AST), синтез речи (TTS), генерацию текста в аудио и общее понимание аудио.

03Производительность и бенчмарки

Главный вопрос, который волнует разработчиков: не потеряла ли модель свои текстовые способности? Ответ — нет. Audex демонстрирует результаты, сопоставимые с ее текстовым «хребтом» Nemotron-Cascade-2-30B-A3B. На бенчмарке MMLU-Redux Audex набирает 86.4 против 86.3 у базовой модели. Более того, на IMO AnswerBench Audex показывает лучший результат — 81.1 против 79.3 у бэкбона.

Сравнение с другими открытыми моделями показывает преимущество Audex. Например, она превосходит Qwen3.5-35B-A3B в нескольких задачах на рассуждение, выравнивание и следование инструкциям. В то же время, конкурент Qwen3-Omni-30B-A3B-Thinking показывает значительное падение в задачах на рассуждение по сравнению со своим собственным бэкбонном, что подтверждает тезис о «налоге на мультимодальность».

Бенчмарк Audex 30B-A3B Qwen3.5-35B-A3B Qwen3-Omni-30B-A3B-Thinking
HMMT Feb25 92.2 89.0 60.4
IMO AnswerBench 81.1 74.8 59.9
LiveCodeBench v6 85.3 74.6 59.2
ArenaHard v2 81.6 65.4 55.1
IFBench (prompt) 77.8 70.2 52.4

В области распознавания речи Audex также лидирует среди открытых моделей. На лидерборде OpenASR средняя ошибка в словах (WER) составляет 6.82, что лучше, чем у Step-Audio-R1.1-33B (7.91) и Qwen3-Omni-30B-A3B-Thinking (8.00).

Однако в задачах общего понимания аудио картина смешанная. Audex лидирует на MMAU и Audio Entailment, но уступает сильным аудио-LLM на MMAR и MMSU. Тем не менее, Audex является одной из немногих открытых моделей, способных генерировать общие звуки (не только речь), что открывает новые возможности для креативных индустрий.

NVIDIA Audex: Революция в аудио-текстовых моделях без потери интеллекта

04Практическое применение: Примеры использования

Давайте рассмотрим, как Audex может быть использована в реальных сценариях:

1. Многоголосные колл-центры

Представьте колл-центр, обслуживающий клиентов из разных стран. Audex может транскрибировать звонок на немецком языке и мгновенно перевести его на английский. Вывод модели включает исходный язык, транскрипцию и перевод, что упрощает работу операторов и снижает барьеры для международного общения.

2. Инструменты доступности

Разработчики могут интегрировать Audex в приложения для чтения с фиксированным голосом. Низкая ошибка в словах (WER) в 1.70 на тесте Seed-TTS-Eval означает, что синтезированная речь будет звучать естественно и точно, что критически важно для пользователей с нарушениями зрения.

3. Звуковой дизайн и прототипирование

Для создателей контента Audex предлагает возможность генерации звуков по текстовому описанию. Запрос «птицы щебечут в лесу» сгенерирует 10-секундный клип. Использование улучшенного VAE позволяет получать звук с частотой 48 кГц, что обеспечивает высокое качество для профессионального использования.

4. Голосовые ассистенты

Хотя распознавание и синтез речи выполняются каскадно, все этапы обслуживаются одной контрольной точкой. Это упрощает архитектуру системы. Audex набирает 90.0 на BigBenchAudio, что свидетельствует о хорошем качестве генерации сложных звуков.

05Быстрый старт: Как запустить Audex

Audex следует шаблону ChatML. Для запуска рекомендуется использовать vLLM версии 0.20.0. Для декодирования аудио необходимо установить дополнительные пакеты (audio extras).

Формат ввода для понимания аудио, распознавания речи и перевода одинаков. Метка указывает место, где находится аудиофайл.

terminaljson
{
  "id": "sample_0",
  "sound": "/path/to/audio_0.wav",
  "conversations": [
    {
      "from": "human",
      "value": "\nDescribe the audio in detail."
    },
    {
      "from": "gpt",
      "value": "N/A"
    }
  ]
}

Для запуска можно использовать следующий скрипт:

NVIDIA Audex: Революция в аудио-текстовых моделях без потери интеллекта
terminalbash
python3 -m pip install "vllm[all]"
python inference_scripts_vllm/audioqa_scripts/run_audioqa_vllm.py \
  --model_path "$(pwd)/checkpoint_folder_full" \
  --input_json inputs.json \
  --output_jsonl results.jsonl \
  --tensor_parallel_size 1

Исследователи рекомендуют использовать параметры top_p=0.9 и temperature=0.7 для задач понимания аудио. Для распознавания и перевода лучше использовать жадную выборку (greedy sampling). Для задач генерации требуется guidance, классифицируемый как «без классификатора» (classifier-free guidance).

⚠️
Важно. Лицензия NVIDIA OneWay Noncommercial License ограничивает коммерческое использование модели. Если вы планируете использовать Audex в коммерческих продуктах, вам необходимо связаться с NVIDIA для получения соответствующих лицензий.

06Сильные и слабые стороны

Сильные стороны

  • Минимальная или отсутствующая регрессия текстовых показателей по сравнению с текстовым бэкбонном.
  • Единая унифицированная модель, совместимая с Megatron-LM и vLLM.
  • Одна из самых сильных открытых моделей, способных генерировать общие звуки (не только речь).
  • Превосходит Qwen3.5-35B-A3B в нескольких задачах на рассуждение и выравнивание.

Слабые стороны

  • Лицензия ограничивает коммерческое использование.
  • В задачах общего понимания аудио есть пробелы на MMAR и MMSU по сравнению с топ-аудио LLM.
  • Распознавание речи в речь (speech-to-speech) выполняется каскадно, а не в режиме full-duplex.
  • Обучение с подкреплением (RL) применяется только к тексту; аудио-текстовый RL является задачей будущего.

07Что это значит на практике

Выход Audex знаменует собой важный шаг в развитии мультимодального ИИ. До сих пор разработчикам приходилось выбирать между качеством текста и качеством аудио, или использовать сложные системы из нескольких моделей. Audex доказывает, что можно объединить эти возможности в одной модели, сохранив при этом высокую интеллектуальную планку.

Для разработчиков из России это означает возможность локального запуска мощной модели для обработки аудио и текста, что особенно актуально в условиях ограничений на доступ к облачным сервисам. Однако необходимо учитывать лицензионные ограничения. Для исследовательских целей, образовательных проектов и внутренних корпоративных задач Audex представляет собой отличный инструмент. Генерация общих звуков открывает новые горизонты для создания иммерсивных сред, игр и медиа-контента.

В будущем мы можем ожидать появления коммерческих версий Audex и моделей, которые решат текущие ограничения в области аудио-текстового RL и full-duplex взаимодействия. Но уже сейчас Audex устанавливает новый стандарт для открытых унифицированных аудио-текстовых моделей.

📌
Резюме. Audex — это не просто еще одна мультимодальная модель. Это демонстрация того, как правильный архитектурный подход и поэтапное обучение могут избежать компромиссов, характерных для мультимодальных систем. Это инструмент, который стоит иметь в арсенале каждому, кто работает с аудио и текстом.

Источник: MarkTechPost ↗