Исследования28 сентября 2026 г., 13:20 МСК🤖 Auto

LLM-фильтр против Whisper: как улучшить распознавание полицейских радиоперехватов

Исследователи из Университета Джонса Хопкинса и других институтов показали, что стандартные метрики надежности ASR не работают на зашумленных полицейских эфирах, а использование LLM в роли судьи снижает ошибку транскрипции.

Баннер новости 8415

Проблема: ASR проваливается на полицейских эфирах

Распознавание речи (ASR) на базе предобученных моделей, таких как Whisper и Qwen3-ASR, демонстрирует крайне низкое качество при обработке зашумленных записей трансляций полиции (Broadcast Police Communication, BPC). Это создает барьер для анализа принятия решений полицией. Основная сложность — отсутствие качественных размеченных данных для дообучения моделей в условиях сильного фонового шума и специфического сленга.

Решение: Псевдолейблинг с LLM-фильтрацией

Авторы исследования (Kaavya Chaparala, Su Huang и соавторы) предложили метод псевдолейблинга, где модели генерируют транскрипты, которые затем фильтруются. Ключевое открытие: внутренние метрики уверенности моделей (логарифмические вероятности и STAR-счета) не способны отличить качественную транскрипцию от ошибочной в домене BPC.

Вместо этого команда внедрила парадигму "LLM-as-a-judge". Большая языковая модель анализирует контекст и отбрасывает транскрипты, которые семантически маловероятны или содержат логические противоречия. Это позволяет очищать обучающие наборы данных без ручного аннотирования.

Эксперимент: Балтимор и Чикаго

Методика была протестирована на корпусах записей из Балтимора и Чикаго. Исследователи сравнили эффективность фильтрации внутренними метриками против внешнего LLM-судьи. Результаты показали, что LLM-фильтр действует агрессивнее и эффективнее снижает ошибку распознавания слов (WER) на псевдопомеченных данных.

Метрика / Метод Результат / Описание
Внутренние метрики (Log-prob, STAR) Не способны достоверно классифицировать качество псевдолейблов в зашумленных эфирах
LLM-as-a-judge Значительно снижает WER за счет отсечения контекстно-невероятных транскриптов
Кросс-модельный псевдолейблинг Дообучение Whisper на данных от Qwen3-ASR (и наоборот) — перспективное направление
Оракульный фильтр (Oracle) Идеальный эталон; между ним и LLM-фильтром остается существенный разрыв в качестве

Выводы и перспективы

Исследование, принятое к публикации на конференции SLT 2026 (Spoken Language Technology), доказывает жизнеспособность unsupervised-подхода для нишевых доменов. Хотя разрыв с идеальной разметкой сохраняется, использование LLM для фильтрации шума открывает путь к созданию более точных систем мониторинга правоохранительной деятельности без колоссальных затрат на ручную аннотацию.

Источник: arXiv cs.AI ↗