Исследования3 июля 2026 г., 20:16 МСК🤖 Auto

SPARCLE: Замена G2P для TTS с точностью до спикера

Исследователи представили SPARCLE — модель, которая заменяет традиционные системы G2P, выравнивая графемы с акустикой Wav2Vec2 с учетом голоса конкретного спикера.

Баннер новости 2870

Конец эпохи G2P в low-resource сценариях

Традиционные системы синтеза речи (TTS) часто опираются на преобразование графем в фонемы (G2P). Однако этот подход страдает от проблемы «многие-к-одному» и не учитывает индивидуальные акустические вариации спикера. Новые исследования, представленные на Interspeech, предлагают решение: SPARCLE (SPeaker-aware Aligned Representations via Contrastive Language Embeddings).

Как работает SPARCLE

Модель обучается с использованием контрастивной функции потерь, которая выравнивает графемы (символы текста) с их точными акустическими реализациями из модели Wav2Vec2. Ключевая инновация — условие по идентичности спикера. Это позволяет модели «понимать», как конкретный человек произносит конкретную букву, устраняя необходимость в промежуточном этапе G2P.

Результаты: снижение ошибки в 2 раза

В условиях экстремального дефицита данных (low-resource settings), где традиционные модели часто терпят неудачу, SPARCLE демонстрирует прорывные результаты. Модель заменяет G2P-системы в downstream-задачах TTS, значительно улучшая качество генерации.

Метрика Стандартные графемные модели SPARCLE
Word Error Rate (WER) Базовый уровень Снижение в 2 раза
Учет вариативности Отсутствует (усреднено) Персонализировано (по спикеру)
Архитектура Grapheme → Phoneme → Audio Grapheme + Speaker ID → Audio

Почему это важно

SPARCLE доказывает, что прямое моделирование графем с учетом акустического контекста спикера превосходит фонемные подходы в сценариях с малым объемом данных. Это открывает путь к созданию более качественных и адаптивных систем синтеза речи для редких языков и специфических голосовых профилей без необходимости сбора огромных датасетов.

Источник: arXiv cs.CL ↗