Проблема: Ошибка распознавания речи искажает факты
Современные системы проверки фактов (fact-checking) традиционно опираются на чистый текстовый контент. Однако в реальной жизни дезинформация чаще распространяется через устную речь. Устные диалоги сложнее: утверждения могут разбиваться между несколькими спикерами, зависеть от контекста предыдущих реплик и, что критично, искажаться ошибками систем автоматического распознавания речи (ASR). Существующие ресурсы были либо слишком маленькими, либо сосредоточенными только на английском языке, без привязки к исходным источникам.
Решение: TRILOGUE — масштабный трехъязычный бенчмарк
Команда исследователей во главе с Чэуэном Чуном (Chaewan Chun) представила TRILOGUE — первый крупномасштабный бенчмарк, позволяющий оценивать модели проверки фактов в условиях реальных устных диалогов. Датасет включает три языка: английский, русский и казахский. Ключевая особенность — наличие не только текстовых транскриптов, но и исходных аудиофайлов с пословной тайм-кодировкой, что позволяет анализировать влияние качества распознавания речи на точность верификации.
Масштаб данных и структура
TRILOGUE содержит почти 12 000 диалогов, 187 000 реплик (turns) и 390 часов синхронизированного аудио. Особое внимание уделено ресурсам для языков с меньшим объемом данных (Low-resource): почти 5 000 файлов диалогов записаны вручную носителями русского и казахского языков, что значительно повышает качество данных по сравнению с машинной генерацией.
| Параметр | Значение |
|---|---|
| Количество диалогов | ~12 000 |
| Количество реплик (turns) | 187 000 |
| Объем аудио | 390 часов |
| Языки | Английский, Русский, Казахский |
| Особенность данных | Пословная тайм-кодировка, наличие исходного аудио |
| Ручная запись (RU/KZ) | ~5 000 диалогов |
Задачи и результаты базовых моделей
Бенчмарк поддерживает три ключевые задачи: определение ценности утверждения для проверки (claim check-worthiness), поиск доказательств в исходных статьях (evidence retrieval) и прямую верификацию утверждений. Модели тестировались в трех сценариях: использование только утверждения, использование золотого стандарта доказательств (gold-evidence) и использование доказательств, найденных самой моделью (retrieved-evidence).
Результаты показали, что шум от ошибок ASR и кросс-лингвальный перенос остаются серьезными препятствиями, особенно для казахского языка. Однако использование извлеченных исходных доказательств существенно сужает разрыв в точности по сравнению с использованием идеальных (gold) доказательств, что открывает путь к созданию более устойчивых систем проверки фактов в реальном времени.
Значение для индустрии
Публикация TRILOGUE (принята к EMNLP 2026) закрывает важный пробел в области NLP, переводя проверку фактов из плоскости «чистого текста» в плоскость «шумных диалогов». Это критически важно для развития голосовых помощников, новостных агрегаторов и систем модерации контента, которые теперь смогут опираться на стандартизированные метрики для оценки своей устойчивости к ошибкам распознавания речи.
Источник: arXiv cs.CL ↗
