2noise/ChatTTS

A generative speech model for daily dialogue.

Аудио⭐ 39 856Pythonпоследний релиз: v0.2.5
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

ChatTTS — это модель синтеза речи (TTS), специально разработанная для генерации естественного диалогового голоса, в том числе с использованием нескольких спикеров.

Зачем нужен

Инструмент решает задачу создания высококачественного и выразительного текста в речь, оптимизированного для сценариев взаимодействия с LLM-ассистентами. Он полезен тем, что позволяет генерировать живую речь с контролем интонаций, пауз, смеха и междометий, превосходя многие открытые аналоги по просодии.

Что можно реализовать

  • Создание голосовых ответов для чат-ботов и AI-ассистентов
  • Генерация многоречевых диалогов для симуляции разговоров
  • Озвучка контента с естественными паузами и эмоциональными вставками
  • Исследование и разработка новых методов синтеза речи
  • Локализация и озвучка материалов на английском и китайском языках

Ключевые возможности

  • Оптимизация под диалоговые задачи и взаимодействие с LLM
  • Поддержка нескольких спикеров для интерактивных бесед
  • Тонкий контроль просодии: смех, паузы, междометия
  • Высокое качество просодии по сравнению с другими open-source моделями
  • Обучена на более чем 100 000 часов аудио (базовая версия 40k часов доступна в open-source)

👤 Кому подойдёт: разработчики, исследователи в области NLP и TTS, создатели AI-ассистентов, энтузиасты open-source

Релизы

v0.2.5patch
🕐 5 мес назад · релиз на GitHub ↗

Выпуск v0.2.5: добавлена частичная поддержка DML, исправлены ошибки выполнения и обновлены зависимости.

  • Added: Добавлена частичная поддержка DML (DirectX Machine Learning).
  • Fixed: Исправлена ошибка RuntimeError в функции narrow, связанная с отрицательной длиной.
  • Fixed: В файл requirements.txt добавлена отсутствующая зависимость requests.
  • Fixed: Обеспечена совместимость с последними версиями библиотеки transformers.