Масштаб и структура датасета
Команда разработчиков под руководством Лукаса Рафаэля Стефанела Гриша (Lucas Rafael Stefanel Gris) представила CVSS-X — масштабный синтетический корпус для перевода речи на речь (speech-to-speech). В отличие от предыдущей версии CVSS, которая переводила с 21 языка на английский, CVSS-X реализует обратную задачу: перевод с английского на 28 целевых языков, охватывающих 12 языковых семей.
Ключевые метрики датасета впечатляют:
- Общий объем: более 16 000 часов аудио.
- Парные примеры: около 240 000 параллельных пар речи на каждый язык.
- Рост: объем данных в 8 раз превышает размер оригинального CVSS.
Технические варианты и качество
Корпус доступен в двух вариантах, что позволяет исследователям выбирать между стабильностью и разнообразием:
- CVSS-X-C: использует два канонических голоса для каждого языка. Это обеспечивает высокую стабильность и предсказуемость результата.
- CVSS-X-T: применяет клонирование голоса кросс-лингвально. Этот вариант добавляет вариативности, имитируя более сложные сценарии использования.
Оценка качества перевода показала результаты, сопоставимые с оригинальным CVSS, при этом производительность остается стабильной даже для типологически разнородных языков. Совместное использование CVSS и CVSS-X позволяет создавать системы двустороннего мультиязычного перевода.
Сравнение версий
| Характеристика | CVSS (оригинал) | CVSS-X (новинка) |
|---|---|---|
| Направление перевода | 21 язык → Английский | Английский → 28 языков |
| Количество языков | 21 | 28 (12 языковых семей) |
| Общий объем данных | ~2 000 часов (оценка) | > 16 000 часов |
| Парных примеров на язык | ~30 000 | ~240 000 |
| Варианты генерации | Стандартные | Канонические (C) и Клонирование (T) |
Доступность и лицензия
Работа принята к публикации на воркшопе SALMA (2-я редакция) в рамках конференции EMNLP 2026. Исходный код и датасет опубликованы под лицензией CC-BY-NC 4.0 (Creative Commons Attribution-NonCommercial). Это делает ресурс доступным для академического сообщества и разработчиков, не преследующих коммерческую выгоду, что стимулирует дальнейшие исследования в области low-resource и multilingual speech processing.
Источник: arXiv cs.CL ↗
