PaddlePaddle/PaddleSpeech

Простой в использовании речевой инструментарий, включающий модели самообучения, SOTA/потоковую ASR с пунктуацией, потоковую TTS с текстовым фронтендом, систему верификации говорящего, сквозное речевое перевод и обнаружение ключевых слов. Победитель NAACL2022 Best Demo Award.

Аудио⭐ 12 686Pythonпоследний релиз: r1.5.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

PaddleSpeech — это открытый инструмент для обработки речи на базе фреймворка PaddlePaddle, включающий модели распознавания, синтеза речи и перевода.

Зачем нужен

Инструмент решает задачи преобразования речи в текст (ASR), текста в речь (TTS), верификации говорящих и перевода речи. Он полезен для создания голосовых интерфейсов, автоматической транскрибации и мультимедийных приложений благодаря наличию state-of-art моделей и награде NAACL2022 Best Demo Award.

Что можно реализовать

  • Создание систем автоматической транскрибации аудио с поддержкой пунктуации
  • Генерация реалистичной речи из текста (TTS) с текстовым фронтендом
  • Распознавание ключевых слов (Keyword Spotting) в потоковом режиме
  • Верификация личности по голосу (Speaker Verification)
  • Перевод речи с английского на китайский язык (End-to-End Speech Translation)

Ключевые возможности

  • Поддержка потокового распознавания (Streaming ASR) и синтеза речи (Streaming TTS)
  • Наличие моделей самообучения (Self-Supervised Learning)
  • Кроссплатформенность: работает на Linux, Windows и macOS
  • Простота установки через PyPI (Python 3.8+)
  • Интеграция с Hugging Face Spaces для демонстраций

👤 Кому подойдёт: Разработчики, исследователи в области обработки естественного языка и аудио, а также компании, внедряющие голосовые технологии.

Релизы

r1.5.0majorbreaking
🕐 18 мес назад · релиз на GitHub ↗

PaddleSpeech 1.5.0: адаптация к Paddle 3.0, поддержка AudioTools/DAC, новые аппаратные бэкенды и исправления.

  • Breaking: Проведена полная адаптация к Paddle 3.0.0-beta, включая рефакторинг 80+ моделей и изменение интерфейсов инференса.
  • Added: Добавлена поддержка AudioTools для обучения и инференса модели DAC, включая новые функции потерь.
  • Added: Расширена поддержка оборудования: добавлены бэкенды GCU и адаптация SpeedySpeech для NPU и MLU.
  • Fixed: Исправлены критические ошибки совместимости с NumPy, SciPy, Whisper, VITS и FastSpeech2.
  • Fixed: Устранены проблемы установки, удалена зависимость paddleaudio и оптимизирована совместимость с Python.