Суть технологии: от видео к тексту без микрофона
LipFlow — это локальное приложение, позволяющее вводить текст, не издавая звуков. Пользователь зажимает клавишу (по умолчанию правый Alt/Ctrl), «проговаривает» фразу перед камерой, и после отпускания клавиши текст появляется в поле курсора. Система работает на базе модели Wispr Flow, обрабатывая видеопоток с частотой 25 кадров в секунду. Ключевое преимущество — полная конфиденциальность: все вычисления происходят на устройстве пользователя, данные не отправляются в облако.
Архитектура и точность распознавания
Процесс состоит из нескольких этапов: захват лицевых ориентиров, выделение области рта, кодирование через VSR-модель (Video Speech Recognition) и декодирование. На Mac используется Apple GPU для ускорения, на Windows/Linux — CPU или NVIDIA CUDA. Для повышения точности применяется опциональная постобработка через LLM (Large Language Model), которая исправляет семантические ошибки, типичные для визуального распознавания речи (например, путаница звуков p/b/m или f/v).
| Режим работы | Точность (ошибки слов) | Требования к оборудованию | Задержка (M4 Pro) |
|---|---|---|---|
| Только губы (Lip-only) | 31.9% | Любая веб-камера | ~0.16 с (GPU) / ~1.7 с (CPU) |
| Губы + шепот (Whisper mode) | 6.9% | Веб-камера + микрофон | Выше из-за аудио-визуальной модели |
| С LLM-коррекцией (Claude) | Минимальная | API ключ или локальная модель | Зависит от скорости LLM |
Персонализация: обучение на лице пользователя
Одной из главных фишек LipFlow является адаптация под конкретного пользователя. При первом запуске приложение предлагает пройти процедуру «Practice & Train»:
- Импорт истории: Если используется Wispr Flow, LipFlow импортирует локальную историю диктовки для изучения стиля речи.
- Обучение модели: Пользователь произносит 24 предложения. Система сохраняет клипы с исправлениями (если пользователь поправил текст в течение 30 секунд) и дообучает модель на лице пользователя.
- Результат: Модель учитывает индивидуальные особенности артикуляции, что значительно повышает точность в долгосрочной перспективе.
Кроссплатформенная поддержка и установка
Проект поддерживает macOS, Windows и Linux, но с нюансами производительности:
- macOS: Требует Apple Silicon (macOS 13+). Использует MLX для локальной LLM-коррекции. Установка через
./setup.shзанимает около 8 минут (загрузка моделей ~1.2 ГБ). - Windows: Требует Windows 10/11. Без NVIDIA GPU распознавание идет на CPU, что увеличивает задержку. LLM-коррекция требует подключения внешних API (Claude, Codex) или локальных моделей через Ollama.
- Linux: Поддержка Wayland и X11. Требует установки специфичных утилит для вставки текста (wl-clipboard, xdotool). LLM-коррекция также вынесена в внешние сервисы.
Почему это важно
LipFlow решает проблему «silent typing» в общественных местах или на совещаниях, где использование микрофона невозможно или неэтично. Интеграция LLM для контекстной коррекции решает главную проблему CV-распознавания речи — гомофонные ошибки. Открытый код и локальная обработка делают решение привлекательным для корпоративного сектора, заботящегося о безопасности данных.
Источник: Github ↗
