Прорыв в неинвазивном интерфейсе «мозг-компьютер»
Лаборатория Meta AI выпустила обновленную версию системы Brain2Qwerty v2, способную в реальном времени преобразовывать сигналы мозга в набранный текст без хирургического вмешательства. В отличие от инвазивных имплантов, эта технология использует внешние датчики MEG, регистрирующие магнитные поля нейронной активности. Система обучалась на данных 9 добровольцев, каждый из которых провел в аппарате 10 часов, набрав в сумме около 22 000 предложений.
Архитектура: от сырых сигналов к семантике
Ключевое отличие v2 от предыдущей версии (выпущенной в феврале 2025 года) — переход от ручного выделения событий к end-to-end глубокому обучению. Пайплайн состоит из трех основных блоков:
- Сверточный энкодер: извлекает признаки напрямую из сырых MEG-сигналов (306 каналов), заменяя инженерные детекторы событий.
- Трансформер: моделирует долгосрочные зависимости во временной структуре сигнала.
- Языковая модель на уровне символов: корректирует ошибки, опираясь на контекст и семантику, отсекая бессмысленные последовательности символов.
Метрики: скачок точности
Результаты тестирования демонстрируют значительный прогресс по сравнению с состоянием искусства (SOTA) для неинвазивных методов. Средняя точность на уровне слов (Word Accuracy) составила 61%, что соответствует ошибке WER 39%. У лучшего участника эксперимента точность достигла 78%, причем более половины предложений содержали не более одной ошибки.
| Метрика | Brain2Qwerty v2 | Предыдущие неинвазивные методы |
|---|---|---|
| Средняя точность слов | 61% | 8% |
| Лучший результат (участник) | 78% | — |
| Уровень декодирования | Символ, слово, предложение | Обычно символы/события |
| Масштабируемость | >Логарифмически-линейная от объема данных | — |
Почему это важно для индустрии
Meta подчеркивает, что точность системы растет логарифмически-линейно с увеличением объема обучающих данных. Это означает, что разрыв между неинвазивными методами и хирургическими имплантами может быть сокращен исключительно за счет сбора большего массива данных, а не только улучшения архитектуры. Исследователи уже могут использовать полный код обучения (v1 и v2) под лицензией CC BY-NC 4.0 для воспроизводимости результатов в нейронауке и разработки биосигнальных интерфейсов.
Источник: MarkTechPost ↗
