Скорость появления новых моделей синтеза речи (Text-to-Speech, TTS) в открытом доступе поражает воображение. Если заглянуть на платформу Hugging Face Hub, то по состоянию на конец сентября 2026 года там уже представлено более 8000 моделей TTS. Это невероятный темп развития технологии, который открывает новые горизонты для разработчиков, исследователей и энтузиастов. Однако, как это часто бывает в быстро развивающихся областях, инфраструктура оценки не успевает за темпами выпуска новых решений. Методология тестирования остается фрагментированной, нестандартизированной и часто неспособной охватить всё многообразие доступных инструментов.
Традиционно «золотым стандартом» в оценке качества синтеза речи считались субъективные человеческие предпочтения, выраженные через такие метрики, как Mean Opinion Score (MOS) или MUSHRA. На этой основе были созданы так называемые «арены» (arenas) — платформы, где пользователи голосуют за лучший результат. Среди них можно выделить TTS Arena v2, Artificial Analysis и Voice Arena. Эти площадки предлагают пользователям прослушивать выходы двух разных моделей и выбирать тот, который звучит естественнее. На основе накопленных голосов рассчитывается рейтинг Elo, обычно с использованием модели Брэдли-Терри. Хотя человеческое восприятие остается конечным арбитром качества, такие системы имеют фундаментальные ограничения, которые мы подробно разберем в этой статье.
01Почему традиционные «арены» не справляются с масштабом?
Главная проблема подходов, основанных на голосованиях пользователей, — отсутствие масштабируемости. В условиях, когда новые модели выходят ежедневно или даже еженедельно, ручная или полуавтоматическая оценка через сравнение «пары к паре» становится узким горлышком. Это частично объясняет, почему открытые модели (open-source) часто остаются в тени на таких платформах. По данным на сентябрь 2026 года, из 92 моделей на Artificial Analysis лишь 16 имеют открытые веса. Аналогичная картина наблюдается и на Voice Arena.
Этот перекос обусловлен практическими факторами. Добавление коммерческой модели, работающей через API, требует от оператора площадки лишь ключа доступа. В то же время для оценки открытой модели необходимо развернуть её на серверах площадки, обеспечить хостинг и обслуживание, что требует значительных вычислительных ресурсов. Коммерческие провайдеры имеют больше мотивации и ресурсов для участия, чем авторы открытых проектов. Кроме того, существует проблема согласованности оценок: невозможно гарантировать, что одни и те же пользователи с одинаковыми критериями «лучшего» звука будут оценивать модели последовательно. Даже предпочтения одного человека меняются со временем, что делает долгосрочные сравнения на основе субъективных голосов неточными.
02Введение Open TTS Leaderboard: Объективность вместо субъективности
Чтобы решить эти проблемы, команда Hugging Face представила Open TTS Leaderboard. Этот инструмент использует объективные метрики для оценки моделей по нескольким ключевым аспектам производительности. Такой подход позволяет сократить время оценки модели с нескольких недель (необходимых для сбора голосов) до нескольких часов. Важно подчеркнуть: Open TTS Leaderboard не заменяет человеческую оценку, а дополняет её, предоставляя быстрый и масштабируемый способ фильтрации и сравнения моделей.
Оценка строится на трех столпах:
- Разборчивость (Intelligibility): Измеряется через ошибку в словах (WER) и символах (CER) между исходным текстом и транскрипцией сгенерированного аудио. Для транскрипции используется модель Qwen3 ASR, которая является лидером на Open ASR Leaderboard среди открытых моделей. Это позволяет точно оценить, насколько правильно модель произносит слова.
- Скорость (Speed): Оценивается через обратный фактор реального времени (RTFx) для пакетного офлайн-вывода на GPU NVIDIA H200. Также измеряется время до первого аудиофрагмента (TTFA) для потоковой передачи с размером пакета 1, как на GPU H200, так и на CPU. Это критически важно для приложений реального времени.
- Сходство голоса (Speaker Similarity): Вычисляется как косинусное сходство (SIM) между эмбеддингами говорящих, полученными из модели WavLM, для сгенерированного аудио и референсного клипа. Эта метрика показывает, насколько хорошо модель сохраняет идентичность голоса оригинала.
Хотя эти метрики не измеряют напрямую естественность, выразительность или эмоциональную окраску, они служат надежным прокси-индикатором разборчивости и сохранения идентичности. Более того, они могут информировать другие рейтинги, помогая отбирать модели для дальнейшего человеческого тестирования.
03Многоязычность: Английский — не универсальный ключ
Одной из главных особенностей Open TTS Leaderboard является фокус на многоязычности. Производительность на английском языке не всегда коррелирует с качеством работы на других языках. Поэтому платформа позволяет переключаться между языками для оценки производительности в разных лингвистических контекстах. В базовом представлении модели ранжируются по макросреднему значению WER на английских сплитах датасетов Seed TTS Eval и CV3 Eval (zero-shot).
На данный момент лидерами по английскому WER являются модели hexgrad/Kokoro-82M, Supertone/supertonic-3 и fishaudio/s2-pro. Однако, если переключиться на оценку многоязычности, картина меняется. Датасет Seed TTS Eval содержит аудио только для английского и китайского языков, поэтому для других языков используются только оценки с CV3 Eval. Для китайского, японского и корейского языков, которые являются языками с иероглифической письменностью, отчет ведется по ошибке в символах (CER), а «Средний WER» рассчитывается как макросреднее по всем языкам.

Среди сильных многоязычных моделей выделяются k2-fsa/OmniVoice, fishaudio/s2-pro и FunAudioLLM/Fun-CosyVoice3-0.5B-2512. Это подчеркивает важность тестирования моделей на разнообразных языковых наборах, чтобы избежать предвзятости в сторону английского языка.
04Клонирование голоса: Сохранение идентичности
Еще одним критически важным аспектом современных TTS-моделей является способность к клонированию голоса. Переключив фильтр «Voice cloning», пользователи могут сравнивать модели, которые поддерживают эту функциональность на выбранных языках. В таблице появляется новый столбец SIM (Speaker Similarity), а также добавляются два дополнительных графика Парето, визуализирующих компромисс между сходством голоса, скоростью пакетного вывода и размером модели.
Интересно отметить, что для некоторых моделей, таких как bosonai/higgs-tts-3-4b и openbmb/VoxCPM2, средний WER улучшается при использовании клонирования голоса, то есть при наличии референсного аудио. Это может быть связано с тем, что наличие референса помогает модели лучше уловить интонационные и фонетические особенности, которые она затем применяет к целевому тексту.

Графики Парето позволяют быстро оценить, какие модели предлагают лучший баланс между качеством (WER/SIM) и ресурсоемкостью (размер модели, скорость). Например, можно найти модель, которая достаточно быстра для работы на CPU, но при этом сохраняет высокое качество речи.
05Потоковая передача: Скорость для интерактивных приложений
Для голосовых агентов и других интерактивных приложений критически важна скорость отклика. Вкладка «Streaming» сравнивает возможности потоковой передачи моделей. Модели ранжируются по времени до первого аудиофрагмента (TTFA), которое измеряет, сколько времени пользователь ждет после ввода текста, прежде чем сможет услышать начало речи.
Для моделей с поддержкой потоковой передачи (отмечены галочкой «Streaming API») это время до первого фрагмента. Для непотоковых моделей это время до генерации всего высказывания, так как воспроизведение не может начаться раньше. Все модели тестируются в режиме «один аудио за раз» (batch size 1) на 50 английских промптах из CV3-Eval, на одном и том же оборудовании и с голосом по умолчанию. Первые три запуска отбрасываются как прогрев, а в отчете указывается медианное значение TTFA.

По умолчанию сравнение проводится на GPU NVIDIA H200. Результаты также доступны для CPU для небольшого, но растущего набора моделей. Модель kyutai/pocket-tts выделяется как отличный вариант для потоковой передачи как на GPU, так и на CPU, что делает её привлекательной для развертывания на устройствах с ограниченными ресурсами.
06Сравнение и голосование: Возвращение человеческого фактора
Хотя объективные метрики дают четкую картину технических характеристик, они не рассказывают всю историю. Как упоминалось ранее, человеческое предпочтение остается конечным арбитром. Вкладка «Listen» заполняет этот пробел, позволяя пользователям сравнивать сгенерированные выходы, стоящие за цифрами, и находить модели, которые им нравятся лично.
Пользователь может выбрать интересующий язык/датасет, решить, хочет ли он сравнивать клонирование голоса, и опционально выбрать конкретные модели или прослушать выходы из случайной выборки. Эта вкладка решает важную задачу: предоставляет пространство для исследования выходов различных моделей. Более того, пользователи могут оставлять обратную связь по сгенерированным выводам. По мере накопления голосов от сообщества эти данные могут быть включены в рейтинг.

Мы призываем пользователей голосовать, но просим авторизовываться через аккаунт Hugging Face, чтобы помочь бороться со спамом и ботами. Это обеспечивает качество и достоверность собираемых данных.
07Что это значит на практике
Для разработчиков и исследователей, работающих с TTS, Open TTS Leaderboard предлагает несколько практических преимуществ. Во-первых, он позволяет быстро отфильтровать модели по техническим характеристикам. Если вам нужна модель для встраивания в мобильное приложение, вы можете отсортировать по TTFA на CPU и размеру модели. Если вам важна точность произношения на нескольких языках, вы можете посмотреть на WER/CER для конкретных языков.
Во-вторых, платформа способствует развитию открытого сообщества. Команда Hugging Face планирует открыть исходные коды скриптов оценки, аналогично репозиторию Open ASR Leaderboard. Это позволит пользователям напрямую предоставлять обратную связь и предложения через GitHub Issues и Pull Requests. Таким образом, оценка TTS-моделей становится совместным усилием сообщества, а не закрытым процессом.
В-третьих, фокус на многоязычности и клонировании голоса отражает реальные потребности бизнеса. Многие компании работают на глобальных рынках и нуждаются в моделях, которые могут клонировать голоса на разных языках без потери качества. Open TTS Leaderboard предоставляет инструменты для оценки именно этих аспектов, что делает его незаменимым для принятия решений о выборе модели.

В заключение, Open TTS Leaderboard — это не просто еще один рейтинг. Это попытка стандартизировать и масштабировать оценку открытых моделей TTS, сочетая объективные метрики с возможностью человеческого участия. Мы приглашаем всех заинтересованных лиц присоединиться к формированию этого инструмента, предлагая новые датасеты, модели и метрики. Давайте вместе будем определять будущее оценки синтеза речи 🤗
Источник: Hugging Face ↗
