NVIDIA/NeMo

A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)

LLM⭐ 18 481Pythonпоследний релиз: v3.0.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

NVIDIA NeMo Speech — это масштабируемый фреймворк на базе PyTorch для работы с моделями распознавания речи (ASR), синтеза речи (TTS) и мультимодальных LLM.

Зачем нужен

Инструмент позволяет исследователям и разработчикам эффективно создавать, дообучать и развертывать модели обработки аудио, используя готовые pre-trained чекпоинты. Он полезен для оптимизации баланса между задержкой (latency) и точностью (WER) в реальном времени, а также для поддержки мультиязычных сценариев.

Что можно реализовать

  • Разработка систем распознавания речи (ASR) с настраиваемой задержкой (от 80 мс до 1 с) и поддержкой множества языков.
  • Создание систем синтеза речи (TTS) для генерации аудио на нескольких языках (например, MagpieTTS).
  • Построение full-duplex голосовых чат-ботов с возможностью прерывания разговора и низкой задержкой (Nemotron VoiceChat).
  • Выполнение перевода речи между европейскими языками с высокой точностью (модели Canary/Parakeet).
  • Инференс и дообучение моделей на GPU NVIDIA с использованием CUDA.

Ключевые возможности

  • Поддержка потоковой (streaming) и офлайн-инференса с возможностью выбора оптимальной точки на кривой «точность-задержка».
  • Мультиязычность: поддержка десятков языков, включая английский, европейские языки, китайский, хинди и другие.
  • Низкая задержка: модели способны обрабатывать до 2400 одновременных потоков на одной H100 с задержкой от 80 мс.
  • Гибкая установка: работает поверх существующего стека Python/PyTorch/CUDA без замены версий, хотя рекомендуется использовать официальные контейнеры NGC.
  • Открытые веса: доступ к чекпоинтам через HuggingFace и NIM для быстрого старта.

👤 Кому подойдёт: Исследователи в области AI, разработчики ML-моделей, инженеры по машинному обучению, работающие с аудио и LLM.

Релизы

v3.0.0majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

Релиз NeMo v3.0.0: новые энкодеры, стриминг, уверенность декодирования, отказ от pickle и поддержка Python 3.14.

  • Added: Добавлены новые архитектуры энкодеров: Transformer Encoder, Causal Transformer и Conformer-style Transformer.
  • Added: Улучшен стриминг: поддержка buffered inference для SALM, confidence в RNN-T и simulated chunked decoding.
  • Breaking: Полностью удалено использование pickle во всей кодовой базе.
  • Added: Введены методы freeze/unfreeze с пометкой experimental и добавлен навык (skill) для fine-tuning ASR.
  • Fixed: Снято ограничение kaldialign для совместимости с Python 3.14 и исправлены проблемы с CUDA graphs.
v2.7.3patch
🕐 5 мес назад · релиз на GitHub ↗

Выпуск v2.7.3: устранение уязвимостей безопасности, исправление ошибок импорта и удаление экспериментальных файлов.

  • Fixed: Устранены известные проблемы безопасности.
  • Fixed: Исправлена ошибка с аргументом nemo_class в скрипте import_hf.py.
  • Fixed: В nemo.lightning.io.mixin внедрен RestrictedUnpickler для повышения безопасности.
  • Deprecated: Удален экспериментальный файл sclite.
  • Fixed: Удалена зависимость diskcache из требований сборки.