Первый крупный релиз после разделения репозитория: фокус на ASR, TTS и SpeechLM2 с интеграцией Automodel и Nemotron VoiceChat.
- Breaking: Репозиторий разделен: LLM, VLM, diffusion и другие компоненты перенесены в отдельные репозитории NVIDIA-NeMo.
- Added: SpeechLM2 теперь поддерживает обучение через NeMo Automodel с нативным LoRA и распределенными стратегиями (FSDP2, HSDP, TP, CP, EP).
- Added: Добавлены модули Nemotron VoiceChat: DuplexSTT, Duplex/EAR-TTS и класс NemotronVoiceChat для speech-to-speech инференса.
- Added: ASR: унифицированная поддержка промптов, ускоренный Transducer decoding (2.4x) и улучшенное потоковое распознавание.
- Fixed: Удалено 800k строк устаревшего кода, миграция на менеджер пакетов uv и оптимизация контейнеров.