Исследования30 июля 2026 г., 10:17 МСК🤖 Auto

60 млн строк диалогов: новый датасет религиозного радио США

Исследователи опубликовали крупнейший корпус транскриптов религиозных радиопередач США, собранный из 785 веб-стримов за июль 2025 года. Датасет объемом более 60 миллионов записей открывает новые возможности для NLP и социологических исследований.

Баннер новости 4701

Масштаб данных: от стримов к миллионам записей

Команда исследователей во главе с Сэмюэлом Бестватером (Samuel Bestvater) представила уникальный Data Descriptor, заполняющий пробел в анализе религиозного вещания в США. В отличие от предыдущих исследований, ограниченных малыми выборками, новый корпус охватывает репрезентативную часть медиаландшафта. Данные были собраны в течение одного месяца — июля 2025 года — путем записи живых веб-стримов.

Ключевые метрики проекта впечатляют:

  • 785 уникальных радиостримов были охвачены мониторингом.
  • Эти стримы ретранслировали сигналы более 2000 AM и FM станций.
  • Всего зафиксировано более 700 000 аудиофайлов (по 15 минут каждый).
  • Итоговый объем транскрипции составил свыше 60 миллионов строк с диаризацией (разделением по говорящим).

Технологический стек: LLM и автоматизация

Обработка такого объема данных невозможна вручную. Авторы применили полностью автоматизированный пайплайн. Сначала аудио было транскрибировано и размечено по говорящим (speaker diarization). Затем, с использованием больших языковых моделей (LLM), каждый сегмент был не только сегментирован, но и классифицирован по формату программы и тематике.

Структура данных организована в виде связанных таблиц, включающих метаданные стримов, метаданные записей и сами строки транскриптов. Это позволяет гибко фильтровать данные по регионам, традициям и темам.

Значение для AI и социологии

Религиозное радио остается «темной материей» в медиааналитике: оно массово, но слабо изучено из-за отсутствия больших данных. Этот корпус (corpus) решает сразу несколько задач:

  1. NLP-исследования: Предоставляет данные для обучения моделей в домене, который ранее был недопредставлен (underrepresented domain), особенно в части распознавания речи и тематического моделирования.
  2. Социальный анализ: Позволяет изучать, как религиозные медиа освещают социальные и политические вопросы в разных регионах США.
  3. Исторический срез: Данные за июль 2025 года станут базой для longitudinal studies (лонгитюдных исследований) дискурса в ближайшие годы.

Детали публикации

Работа была представлена на конференции IC2S2 2026 и опубликована в arXiv (cs.CL). Авторы подчеркивают, что открытость данных способствует прозрачности исследований в области компьютерных наук и общества (cs.CY) и обработки звука (cs.SD).

Источник: arXiv cs.CL ↗