Инструменты3 октября 2026 г., 07:17 МСК🤖 Auto

Open TTS Leaderboard: Масштабируемая оценка TTS и клонирования голоса

Hugging Face представил Open TTS Leaderboard, решив проблему нехватки стандартизированных метрик для 8000+ моделей. Оценка теперь основана на объективных данных: WER, скорости и схожести голоса.

Баннер новости 8839

Проблема масштабируемости и субъективности

По состоянию на 30 сентября 2026 года на Hugging Face Hub доступно более 8000 моделей TTS. Существующие лидерборды (TTS Arena, Voice Arena) опираются на человеческие предпочтения (Elo-рейтинг), что создает два критических барьера:

  • Масштабируемость: Добавление новой модели в «арену» требует ручной настройки и хостинга, что занимает недели. В то время как API-модели добавляются мгновенно.
  • Предвзятость: На Artificial Analysis из 92 моделей только 16 имеют открытый вес (open-weights). Коммерческие игроки доминируют, так как им проще интегрировать API, чем открывать веса.

Новая методология: Объективные метрики

Open TTS Leaderboard заменяет субъективное голосование на автоматизированную оценку за часы. Используются три ключевых показателя:

  1. Разборчивость (Intelligibility): WER/CER через ASR-модель Qwen3 (лидер Open ASR Leaderboard).
  2. Скорость (Speed): Инверсный реальный временной фактор (RTFx) для пакетного вывода на GPU H200 и время до первого аудио (TTFA) для стриминга (batch size 1).
  3. Схожесть голоса (Speaker Similarity): Косинусное сходство (SIM) эмбеддингов WavLM между сгенерированным и референсным аудио.

Лидеры по языкам и клонированию

Оценка разделена на англоязычные и мультиязычные сплиты. Для китайского, японского и корейского языков используется CER (Character Error Rate). В таблице ниже представлены модели-лидеры по ключевым метрикам:

Категория Модель Ключевая метрика / Особенность
Английский WER hexgrad/Kokoro-82M Лидер по макросреднему WER (Seed TTS + CV3 Eval)
Английский WER Supertone/supertonic-3 Высокая точность транскрипции
Мультиязычность k2-fsa/OmniVoice Сильные результаты на нескольких языках
Мультиязычность fishaudio/s2-pro Баланс качества и скорости
Стриминг (GPU/CPU) kyutai/pocket-tts Лучший TTFA для интерактивных приложений

Важные нюансы: Клонирование и «Слушать»

Отдельный режим «Voice cloning» показывает, что некоторые модели (например, bosonai/higgs-tts-3-4b и openbmb/VoxCPM2) улучшают показатели WER при наличии референсного аудио, что указывает на эффективное использование контекста. Однако метрики SIM не измеряют естественность или выразительность. Для этого на платформе добавлена вкладка «Listen», позволяющая сравнивать аудио на слух и голосовать, дополняя объективные данные человеческим восприятием.

Почему это важно

Инициатива Hugging Face демократизирует доступ к качественным TTS-моделям, давая возможность open-source разработчикам конкурировать с коммерческими гигантами на равных. Скрипты оценки будут открыты на GitHub, что позволит сообществу самостоятельно добавлять новые датасеты и метрики, формируя актуальный стандарт качества в индустрии.

Источник: Hugging Face blog ↗