Новый подход к KWS
Команда исследователей во главе с Гаопэном Сюй (Gaopeng Xu) представила архитектуру PromptKWS, предназначенную для решения проблем систем обнаружения ключевых слов (Keyword Spotting, KWS) с открытым словарем. В отличие от традиционных моделей, зависящих только от акустических данных, PromptKWS интегрирует семантическое понимание через текстовые промпты, что критически важно для гибкости системы.
Архитектура PPN и MHCA
Ключевым компонентом системы является Prompt Phrases Prediction Network (PPN) — архитектура «энкодер-декодер», извлекающая эмбеддинги ключевых слов. Эти эмбеддинги затем внедряются в основной энкодер KWS с помощью механизма Prompt-acoustic Multi-head Cross-attention (MHCA). Этот подход позволяет модели «понимать» контекст команды, а не просто сопоставлять звуковые паттерны.
Результаты бенчмарков
Эксперименты показали значительное превосходство PromptKWS над базовыми акустическими моделями, особенно в сложных условиях. Система демонстрирует устойчивость к фоновому шуму и вариациям произношения, что является главной болью при внедрении голосовых ассистентов в реальных устройствах.
| Метрика | Результат PromptKWS | Сравнение с базой |
|---|---|---|
| Улучшение скорости пробуждения (Wakeup Rate) | +10% и более | Против базовой системы |
| Точность в шумных условиях | +15% в среднем | Против чисто акустических моделей |
| Устойчивость к вариациям произношения | Высокая | Значительно лучше аналогов |
Значение для индустрии
Работа, опубликованная 11 августа 2026 года в arXiv (cs.CL), открывает путь к созданию более надежных голосовых интерфейсов для IoT-устройств и умного дома. Способность системы адаптироваться к «открытому словарю» без переобучения на каждый новый ключевой фраз делает её масштабируемой для массового внедрения.
Источник: arXiv cs.CL ↗
