NVIDIA-NeMo/Speech

Масштабируемая генеративная AI-платформа для исследователей и разработчиков, работающих с LLM, мультимодальными моделями и Speech AI (ASR и TTS)

Аудио⭐ 18 481Pythonпоследний релиз: v3.0.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

NVIDIA NeMo Speech — это масштабируемый фреймворк на базе PyTorch для создания, настройки и развертывания моделей распознавания (ASR) и синтеза речи (TTS).

Зачем нужен

Инструмент позволяет исследователям и разработчикам эффективно обучать новые модели и использовать готовые предобученные чекпоинты. Он полезен для оптимизации процессов разработки в области обработки аудио и мультимодальных LLM, обеспечивая поддержку как офлайн, так и потоковой обработки.

Что можно реализовать

  • Разработка систем распознавания речи (ASR) с поддержкой потоковой передачи и настраиваемой задержкой (от 80 мс до 1 с).
  • Создание мультоязычных систем синтеза речи (TTS), таких как MagpieTTS, поддерживающих десятки языков.
  • Реализация полнодуплексных голосовых чатов (VoiceChat) с естественным прерыванием диалога и низкой задержкой.
  • Проведение исследований в области Speech LLM и мультимодальных моделей с использованием готовых архитектур.

Ключевые возможности

  • Поддержка широкого спектра моделей: ASR, TTS и Speech LLM в едином фреймворке.
  • Наличие оптимизированных моделей для потоковой обработки с контролем задержки (например, Nemotron-3.5-ASR-Streaming).
  • Многоязычность: поддержка десятков языков в моделях TTS и ASR (включая Parakeet и Canary).
  • Гибкие требования к окружению: работает с Python 3.12+, PyTorch 2.7+ и CUDA, не заменяя существующие сборки.
  • Активная разработка и регулярные релизы новых чекпоинтов через HuggingFace и NGC.

👤 Кому подойдёт: Исследователи и разработчики, работающие с PyTorch и NVIDIA GPU, специализирующиеся на задачах Speech AI и мультимодальных LLM.

Релизы

v3.0.0majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

Первый крупный релиз после разделения репозитория: фокус на ASR, TTS и SpeechLM2 с интеграцией Automodel и Nemotron VoiceChat.

  • Breaking: Репозиторий разделен: LLM, VLM, diffusion и другие компоненты перенесены в отдельные репозитории NVIDIA-NeMo.
  • Added: SpeechLM2 теперь поддерживает обучение через NeMo Automodel с нативным LoRA и распределенными стратегиями (FSDP2, HSDP, TP, CP, EP).
  • Added: Добавлены модули Nemotron VoiceChat: DuplexSTT, Duplex/EAR-TTS и класс NemotronVoiceChat для speech-to-speech инференса.
  • Added: ASR: унифицированная поддержка промптов, ускоренный Transducer decoding (2.4x) и улучшенное потоковое распознавание.
  • Fixed: Удалено 800k строк устаревшего кода, миграция на менеджер пакетов uv и оптимизация контейнеров.