Масштаб данных: от стримов к миллионам записей
Команда исследователей во главе с Сэмюэлом Бестватером (Samuel Bestvater) представила уникальный Data Descriptor, заполняющий пробел в анализе религиозного вещания в США. В отличие от предыдущих исследований, ограниченных малыми выборками, новый корпус охватывает репрезентативную часть медиаландшафта. Данные были собраны в течение одного месяца — июля 2025 года — путем записи живых веб-стримов.
Ключевые метрики проекта впечатляют:
- 785 уникальных радиостримов были охвачены мониторингом.
- Эти стримы ретранслировали сигналы более 2000 AM и FM станций.
- Всего зафиксировано более 700 000 аудиофайлов (по 15 минут каждый).
- Итоговый объем транскрипции составил свыше 60 миллионов строк с диаризацией (разделением по говорящим).
Технологический стек: LLM и автоматизация
Обработка такого объема данных невозможна вручную. Авторы применили полностью автоматизированный пайплайн. Сначала аудио было транскрибировано и размечено по говорящим (speaker diarization). Затем, с использованием больших языковых моделей (LLM), каждый сегмент был не только сегментирован, но и классифицирован по формату программы и тематике.
Структура данных организована в виде связанных таблиц, включающих метаданные стримов, метаданные записей и сами строки транскриптов. Это позволяет гибко фильтровать данные по регионам, традициям и темам.
Значение для AI и социологии
Религиозное радио остается «темной материей» в медиааналитике: оно массово, но слабо изучено из-за отсутствия больших данных. Этот корпус (corpus) решает сразу несколько задач:
- NLP-исследования: Предоставляет данные для обучения моделей в домене, который ранее был недопредставлен (underrepresented domain), особенно в части распознавания речи и тематического моделирования.
- Социальный анализ: Позволяет изучать, как религиозные медиа освещают социальные и политические вопросы в разных регионах США.
- Исторический срез: Данные за июль 2025 года станут базой для longitudinal studies (лонгитюдных исследований) дискурса в ближайшие годы.
Детали публикации
Работа была представлена на конференции IC2S2 2026 и опубликована в arXiv (cs.CL). Авторы подчеркивают, что открытость данных способствует прозрачности исследований в области компьютерных наук и общества (cs.CY) и обработки звука (cs.SD).
Источник: arXiv cs.CL ↗
