Проблема масштабируемости и субъективности
По состоянию на 30 сентября 2026 года на Hugging Face Hub доступно более 8000 моделей TTS. Существующие лидерборды (TTS Arena, Voice Arena) опираются на человеческие предпочтения (Elo-рейтинг), что создает два критических барьера:
- Масштабируемость: Добавление новой модели в «арену» требует ручной настройки и хостинга, что занимает недели. В то время как API-модели добавляются мгновенно.
- Предвзятость: На Artificial Analysis из 92 моделей только 16 имеют открытый вес (open-weights). Коммерческие игроки доминируют, так как им проще интегрировать API, чем открывать веса.
Новая методология: Объективные метрики
Open TTS Leaderboard заменяет субъективное голосование на автоматизированную оценку за часы. Используются три ключевых показателя:
- Разборчивость (Intelligibility): WER/CER через ASR-модель Qwen3 (лидер Open ASR Leaderboard).
- Скорость (Speed): Инверсный реальный временной фактор (RTFx) для пакетного вывода на GPU H200 и время до первого аудио (TTFA) для стриминга (batch size 1).
- Схожесть голоса (Speaker Similarity): Косинусное сходство (SIM) эмбеддингов WavLM между сгенерированным и референсным аудио.
Лидеры по языкам и клонированию
Оценка разделена на англоязычные и мультиязычные сплиты. Для китайского, японского и корейского языков используется CER (Character Error Rate). В таблице ниже представлены модели-лидеры по ключевым метрикам:
| Категория | Модель | Ключевая метрика / Особенность |
|---|---|---|
| Английский WER | hexgrad/Kokoro-82M | Лидер по макросреднему WER (Seed TTS + CV3 Eval) |
| Английский WER | Supertone/supertonic-3 | Высокая точность транскрипции |
| Мультиязычность | k2-fsa/OmniVoice | Сильные результаты на нескольких языках |
| Мультиязычность | fishaudio/s2-pro | Баланс качества и скорости |
| Стриминг (GPU/CPU) | kyutai/pocket-tts | Лучший TTFA для интерактивных приложений |
Важные нюансы: Клонирование и «Слушать»
Отдельный режим «Voice cloning» показывает, что некоторые модели (например, bosonai/higgs-tts-3-4b и openbmb/VoxCPM2) улучшают показатели WER при наличии референсного аудио, что указывает на эффективное использование контекста. Однако метрики SIM не измеряют естественность или выразительность. Для этого на платформе добавлена вкладка «Listen», позволяющая сравнивать аудио на слух и голосовать, дополняя объективные данные человеческим восприятием.
Почему это важно
Инициатива Hugging Face демократизирует доступ к качественным TTS-моделям, давая возможность open-source разработчикам конкурировать с коммерческими гигантами на равных. Скрипты оценки будут открыты на GitHub, что позволит сообществу самостоятельно добавлять новые датасеты и метрики, формируя актуальный стандарт качества в индустрии.
Источник: Hugging Face blog ↗
