Проблема: ASR проваливается на полицейских эфирах
Распознавание речи (ASR) на базе предобученных моделей, таких как Whisper и Qwen3-ASR, демонстрирует крайне низкое качество при обработке зашумленных записей трансляций полиции (Broadcast Police Communication, BPC). Это создает барьер для анализа принятия решений полицией. Основная сложность — отсутствие качественных размеченных данных для дообучения моделей в условиях сильного фонового шума и специфического сленга.
Решение: Псевдолейблинг с LLM-фильтрацией
Авторы исследования (Kaavya Chaparala, Su Huang и соавторы) предложили метод псевдолейблинга, где модели генерируют транскрипты, которые затем фильтруются. Ключевое открытие: внутренние метрики уверенности моделей (логарифмические вероятности и STAR-счета) не способны отличить качественную транскрипцию от ошибочной в домене BPC.
Вместо этого команда внедрила парадигму "LLM-as-a-judge". Большая языковая модель анализирует контекст и отбрасывает транскрипты, которые семантически маловероятны или содержат логические противоречия. Это позволяет очищать обучающие наборы данных без ручного аннотирования.
Эксперимент: Балтимор и Чикаго
Методика была протестирована на корпусах записей из Балтимора и Чикаго. Исследователи сравнили эффективность фильтрации внутренними метриками против внешнего LLM-судьи. Результаты показали, что LLM-фильтр действует агрессивнее и эффективнее снижает ошибку распознавания слов (WER) на псевдопомеченных данных.
| Метрика / Метод | Результат / Описание |
|---|---|
| Внутренние метрики (Log-prob, STAR) | Не способны достоверно классифицировать качество псевдолейблов в зашумленных эфирах |
| LLM-as-a-judge | Значительно снижает WER за счет отсечения контекстно-невероятных транскриптов |
| Кросс-модельный псевдолейблинг | Дообучение Whisper на данных от Qwen3-ASR (и наоборот) — перспективное направление |
| Оракульный фильтр (Oracle) | Идеальный эталон; между ним и LLM-фильтром остается существенный разрыв в качестве |
Выводы и перспективы
Исследование, принятое к публикации на конференции SLT 2026 (Spoken Language Technology), доказывает жизнеспособность unsupervised-подхода для нишевых доменов. Хотя разрыв с идеальной разметкой сохраняется, использование LLM для фильтрации шума открывает путь к созданию более точных систем мониторинга правоохранительной деятельности без колоссальных затрат на ручную аннотацию.
Источник: arXiv cs.AI ↗
