Исследования31 июля 2026 г., 06:17 МСК🤖 Auto

Voice Memory: Агенты распознавания речи с нулевыми параметрами

Исследователи представили Voice Memory — схему только для инференса, которая улучшает WER до 7.52% без изменения весов моделей, используя асинхронную коррекцию через память.

Баннер новости 4778

Архитектура «Слушатель-Мыслитель»

Команда авторов во главе с Чхао-Ханом Хаком Янгом (Chao-Han Huck Yang) представила метод Voice Memory, предназначенный для агентов распознавания речи (ASR). В отличие от традиционных подходов, эта схема является inference-only (только для инференса) и не требует дообучения или изменения весов базовых моделей. Архитектура разделяет роли на «слушателя» (распознавание) и «мыслителя» (корректор), которые связаны исключительно через файл памяти.

В процессе работы «замороженный» корректор анализирует контекст и принимает решение: использовать гипотезу распознавания или воздержаться. Асинхронный оптимизатор, управляемый оценками (score-gated), вносит изменения в файл памяти, принимая только те правки, которые строго улучшают метрику на валидационной выборке.

Проблема избыточной коррекции

Ключевой вывод исследования заключается в том, что сдержанность (restraint) является критически важным навыком для агентов. Авторы обнаружили, что неограниченная генеративная коррекция ошибок (GER) часто приводит к переобучению на лету, ломая правильные токены. На финансовых новостях GER вносила ошибки в 64% случаев редактирования, тогда как Voice Memory снизила этот показатель до 35%.

Результаты бенчмарков

Тестирование проводилось на десяти доменах HyPoradise. Использование Voice Memory позволило снизить взвешенную ошибку слов (weighted WER) с 8.36% до 7.52% (и до 7.47% при добавлении трех примеров в контекст). При этом ни один из датасетов не показал регрессии по сравнению с базовой линией (1-best). Наибольший прирост достигнут в сложных условиях:

Домен / Условия Базовый WER Voice Memory WER Улучшение
Команды авиаперелетов 8.40% 3.40% +4.00%
Шумный дальний звук (CHiME-4) 12.69% 10.46% +2.23%
Средний WER (10 доменов) 8.36% 7.52% +0.84%

Практическая значимость

Главное преимущество Voice Memory — переносимость (portability) и аудируемость (audibility) навыков. Память легко переносится между разными семействами корректоров, а в путь инференса добавляется ноль параметров. Это решает проблему «черного ящика» в агентах ИИ, позволяя точно отслеживать, какие именно знания были извлечены из данных. Исследователи опубликовали демо-версию и пример кода для дальнейшего изучения метода.

Источник: arXiv cs.CL ↗