Исследования16 сентября 2026 г., 05:18 МСК🤖 Auto

CVSS-X: 16 000 часов синтетического перевода речи на 28 языков

Исследователи представили CVSS-X — крупнейший корпус для синтеза речи, позволяющий переводить английский язык на 28 языков. Датасет в 8 раз больше предшественника и открывает путь к двустороннему мультиязычному переводу.

Баннер новости 7594

Масштаб и структура датасета

Команда разработчиков под руководством Лукаса Рафаэля Стефанела Гриша (Lucas Rafael Stefanel Gris) представила CVSS-X — масштабный синтетический корпус для перевода речи на речь (speech-to-speech). В отличие от предыдущей версии CVSS, которая переводила с 21 языка на английский, CVSS-X реализует обратную задачу: перевод с английского на 28 целевых языков, охватывающих 12 языковых семей.

Ключевые метрики датасета впечатляют:

  • Общий объем: более 16 000 часов аудио.
  • Парные примеры: около 240 000 параллельных пар речи на каждый язык.
  • Рост: объем данных в 8 раз превышает размер оригинального CVSS.

Технические варианты и качество

Корпус доступен в двух вариантах, что позволяет исследователям выбирать между стабильностью и разнообразием:

  • CVSS-X-C: использует два канонических голоса для каждого языка. Это обеспечивает высокую стабильность и предсказуемость результата.
  • CVSS-X-T: применяет клонирование голоса кросс-лингвально. Этот вариант добавляет вариативности, имитируя более сложные сценарии использования.

Оценка качества перевода показала результаты, сопоставимые с оригинальным CVSS, при этом производительность остается стабильной даже для типологически разнородных языков. Совместное использование CVSS и CVSS-X позволяет создавать системы двустороннего мультиязычного перевода.

Сравнение версий

Характеристика CVSS (оригинал) CVSS-X (новинка)
Направление перевода 21 язык → Английский Английский → 28 языков
Количество языков 21 28 (12 языковых семей)
Общий объем данных ~2 000 часов (оценка) > 16 000 часов
Парных примеров на язык ~30 000 ~240 000
Варианты генерации Стандартные Канонические (C) и Клонирование (T)

Доступность и лицензия

Работа принята к публикации на воркшопе SALMA (2-я редакция) в рамках конференции EMNLP 2026. Исходный код и датасет опубликованы под лицензией CC-BY-NC 4.0 (Creative Commons Attribution-NonCommercial). Это делает ресурс доступным для академического сообщества и разработчиков, не преследующих коммерческую выгоду, что стимулирует дальнейшие исследования в области low-resource и multilingual speech processing.

Источник: arXiv cs.CL ↗