open-mmlab/Amphion

Amphion — это набор инструментов для генерации аудио, музыки и речи, предназначенный для поддержки воспроизводимых исследований и помощи начинающим исследователям и инженерам в освоении этой области.

Аудио⭐ 10 302Pythonпоследний релиз: v0.1.1-alpha
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Amphion — это open-source инструмент для генерации аудио, музыки и речи, поддерживающий воспроизводимые исследования и разработку.

Зачем нужен

Инструмент помогает исследователям и инженерам быстро начать работу в области генерации звука, предоставляя готовые модели и метрики. Его ключевая цель — создание платформы для преобразования любых входных данных в аудио, включая поддержку визуализации архитектур моделей для лучшего понимания.

Что можно реализовать

  • Генерация речи из текста (TTS) и синтез вокала (SVS)
  • Преобразование голоса (VC), акцента (AC) и пения (SVC)
  • Генерация звуковых эффектов (TTA) и музыки (TTM)
  • Использование нейросетевых кодеков (например, DualCodec) для эффективной генерации речи
  • Исследование унифицированных моделей генерации речи (например, Metis или Vevo2)

Ключевые возможности

  • Поддержка широкого спектра задач: TTS, SVS, VC, AC, SVC, TTA, TTM
  • Наличие визуализаций классических моделей для обучения и анализа
  • Встроенные vocoder'ы и метрики для оценки качества генерации
  • Доступ к крупным датасетам, таким как Emilia-Large (более 200 000 часов)
  • Развитие унифицированных фреймворков (Vevo, Metis) для совместной генерации речи и пения

👤 Кому подойдёт: исследователи, инженеры-разработчики, студенты, начинающие специалисты в области аудио и speech generation

Релизы

v0.1.1-alphaminor
🕐 31 мес назад · релиз на GitHub ↗

Релиз Amphion v0.1.1-alpha: добавлен VALL-E, DiffWave, поддержка Docker, улучшена оценка говорящих и исправлены критические ошибки.

  • Added: Добавлен диффузионный вокодер DiffWave и предобученная модель VALL-E на датасете Librilight.
  • Added: Внедрена поддержка установки через Docker и улучшен модуль многоязычной фронтенд-обработки.
  • Added: Расширены инструменты оценки: добавлены Resemblyzer, WavLM для проверки сходства говорящих и визуализация.
  • Fixed: Исправлены ошибки в VITS (возобновление обучения), G2P, совместимость с пакетом accelerate и скрипты MFA.
  • Added: Добавлены пресепроцессоры для HifiTTS и Librilight, а также поддержка кастомных датасетов для SVC.