Архитектура «Слушатель-Мыслитель»
Команда авторов во главе с Чхао-Ханом Хаком Янгом (Chao-Han Huck Yang) представила метод Voice Memory, предназначенный для агентов распознавания речи (ASR). В отличие от традиционных подходов, эта схема является inference-only (только для инференса) и не требует дообучения или изменения весов базовых моделей. Архитектура разделяет роли на «слушателя» (распознавание) и «мыслителя» (корректор), которые связаны исключительно через файл памяти.
В процессе работы «замороженный» корректор анализирует контекст и принимает решение: использовать гипотезу распознавания или воздержаться. Асинхронный оптимизатор, управляемый оценками (score-gated), вносит изменения в файл памяти, принимая только те правки, которые строго улучшают метрику на валидационной выборке.
Проблема избыточной коррекции
Ключевой вывод исследования заключается в том, что сдержанность (restraint) является критически важным навыком для агентов. Авторы обнаружили, что неограниченная генеративная коррекция ошибок (GER) часто приводит к переобучению на лету, ломая правильные токены. На финансовых новостях GER вносила ошибки в 64% случаев редактирования, тогда как Voice Memory снизила этот показатель до 35%.
Результаты бенчмарков
Тестирование проводилось на десяти доменах HyPoradise. Использование Voice Memory позволило снизить взвешенную ошибку слов (weighted WER) с 8.36% до 7.52% (и до 7.47% при добавлении трех примеров в контекст). При этом ни один из датасетов не показал регрессии по сравнению с базовой линией (1-best). Наибольший прирост достигнут в сложных условиях:
| Домен / Условия | Базовый WER | Voice Memory WER | Улучшение |
|---|---|---|---|
| Команды авиаперелетов | 8.40% | 3.40% | +4.00% |
| Шумный дальний звук (CHiME-4) | 12.69% | 10.46% | +2.23% |
| Средний WER (10 доменов) | 8.36% | 7.52% | +0.84% |
Практическая значимость
Главное преимущество Voice Memory — переносимость (portability) и аудируемость (audibility) навыков. Память легко переносится между разными семействами корректоров, а в путь инференса добавляется ноль параметров. Это решает проблему «черного ящика» в агентах ИИ, позволяя точно отслеживать, какие именно знания были извлечены из данных. Исследователи опубликовали демо-версию и пример кода для дальнейшего изучения метода.
Источник: arXiv cs.CL ↗
