fishaudio/fish-speech

SOTA Open Source TTS

Аудио⭐ 32 765Pythonпоследний релиз: v1.5.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Fish Speech — это система синтеза речи (TTS) с открытым исходным кодом, использующая архитектуру Dual-Autoregressive и обучение с подкреплением для генерации высококачественной речи.

Зачем нужен

Инструмент решает задачу создания максимально естественной и эмоционально богатой речи, превосходящей многие закрытые аналоги. Он полезен благодаря поддержке более 80 языков, точному клонированию голоса и возможности тонкого управления интонацией через текстовые теги.

Что можно реализовать

  • Генерация многоязычного контента с клонированием голоса по короткому аудиообразцу
  • Создание диалоговых систем и LLM-агентов с реалистичным голосовым выводом
  • Точный контроль эмоций и просодии через текстовые инструкции (например, [whisper], [excited])
  • Локальный запуск TTS-сервера для приватных задач без использования облачных API

Ключевые возможности

  • Архитектура Dual-AR с RL-выравниванием для качества, сравнимого с SOTA закрытых моделей
  • Поддержка более 80 языков и обучение на датасете объемом 10 млн часов
  • Гранулярный контроль эмоций и просодии с помощью текстовых тегов
  • Нативная поддержка многоречевых и многооборотных диалогов
  • Готовые интеграции с vLLM и SGLang для высокопроизводительного серверного развертывания

👤 Кому подойдёт: разработчики, исследователи, создатели контента, инженеры AI-агентов

Релизы

v1.5.1patch
🕐 15 мес назад · релиз на GitHub ↗

Последняя стабильная ветка перед следующим релизом модели.

  • Релиз представляет собой финальную стабильную версию перед выпуском новой модели.