Конец эпохи G2P в low-resource сценариях
Традиционные системы синтеза речи (TTS) часто опираются на преобразование графем в фонемы (G2P). Однако этот подход страдает от проблемы «многие-к-одному» и не учитывает индивидуальные акустические вариации спикера. Новые исследования, представленные на Interspeech, предлагают решение: SPARCLE (SPeaker-aware Aligned Representations via Contrastive Language Embeddings).
Как работает SPARCLE
Модель обучается с использованием контрастивной функции потерь, которая выравнивает графемы (символы текста) с их точными акустическими реализациями из модели Wav2Vec2. Ключевая инновация — условие по идентичности спикера. Это позволяет модели «понимать», как конкретный человек произносит конкретную букву, устраняя необходимость в промежуточном этапе G2P.
Результаты: снижение ошибки в 2 раза
В условиях экстремального дефицита данных (low-resource settings), где традиционные модели часто терпят неудачу, SPARCLE демонстрирует прорывные результаты. Модель заменяет G2P-системы в downstream-задачах TTS, значительно улучшая качество генерации.
| Метрика | Стандартные графемные модели | SPARCLE |
|---|---|---|
| Word Error Rate (WER) | Базовый уровень | Снижение в 2 раза |
| Учет вариативности | Отсутствует (усреднено) | Персонализировано (по спикеру) |
| Архитектура | Grapheme → Phoneme → Audio | Grapheme + Speaker ID → Audio |
Почему это важно
SPARCLE доказывает, что прямое моделирование графем с учетом акустического контекста спикера превосходит фонемные подходы в сценариях с малым объемом данных. Это открывает путь к созданию более качественных и адаптивных систем синтеза речи для редких языков и специфических голосовых профилей без необходимости сбора огромных датасетов.
Источник: arXiv cs.CL ↗
