Инструменты3 октября 2026 г., 19:46 МСК🤖 Auto

LipFlow: Беззвучный ввод текста через веб-камеру с ИИ-коррекцией

Новый open-source проект LipFlow превращает веб-камеру в инструмент для silent dictation. Приложение распознает движения губ локально на Mac, Windows и Linux, а ИИ-модель исправляет ошибки распознавания.

Баннер новости 8865

Суть технологии: от видео к тексту без микрофона

LipFlow — это локальное приложение, позволяющее вводить текст, не издавая звуков. Пользователь зажимает клавишу (по умолчанию правый Alt/Ctrl), «проговаривает» фразу перед камерой, и после отпускания клавиши текст появляется в поле курсора. Система работает на базе модели Wispr Flow, обрабатывая видеопоток с частотой 25 кадров в секунду. Ключевое преимущество — полная конфиденциальность: все вычисления происходят на устройстве пользователя, данные не отправляются в облако.

Архитектура и точность распознавания

Процесс состоит из нескольких этапов: захват лицевых ориентиров, выделение области рта, кодирование через VSR-модель (Video Speech Recognition) и декодирование. На Mac используется Apple GPU для ускорения, на Windows/Linux — CPU или NVIDIA CUDA. Для повышения точности применяется опциональная постобработка через LLM (Large Language Model), которая исправляет семантические ошибки, типичные для визуального распознавания речи (например, путаница звуков p/b/m или f/v).

Режим работы Точность (ошибки слов) Требования к оборудованию Задержка (M4 Pro)
Только губы (Lip-only) 31.9% Любая веб-камера ~0.16 с (GPU) / ~1.7 с (CPU)
Губы + шепот (Whisper mode) 6.9% Веб-камера + микрофон Выше из-за аудио-визуальной модели
С LLM-коррекцией (Claude) Минимальная API ключ или локальная модель Зависит от скорости LLM

Персонализация: обучение на лице пользователя

Одной из главных фишек LipFlow является адаптация под конкретного пользователя. При первом запуске приложение предлагает пройти процедуру «Practice & Train»:

  • Импорт истории: Если используется Wispr Flow, LipFlow импортирует локальную историю диктовки для изучения стиля речи.
  • Обучение модели: Пользователь произносит 24 предложения. Система сохраняет клипы с исправлениями (если пользователь поправил текст в течение 30 секунд) и дообучает модель на лице пользователя.
  • Результат: Модель учитывает индивидуальные особенности артикуляции, что значительно повышает точность в долгосрочной перспективе.

Кроссплатформенная поддержка и установка

Проект поддерживает macOS, Windows и Linux, но с нюансами производительности:

  • macOS: Требует Apple Silicon (macOS 13+). Использует MLX для локальной LLM-коррекции. Установка через ./setup.sh занимает около 8 минут (загрузка моделей ~1.2 ГБ).
  • Windows: Требует Windows 10/11. Без NVIDIA GPU распознавание идет на CPU, что увеличивает задержку. LLM-коррекция требует подключения внешних API (Claude, Codex) или локальных моделей через Ollama.
  • Linux: Поддержка Wayland и X11. Требует установки специфичных утилит для вставки текста (wl-clipboard, xdotool). LLM-коррекция также вынесена в внешние сервисы.

Почему это важно

LipFlow решает проблему «silent typing» в общественных местах или на совещаниях, где использование микрофона невозможно или неэтично. Интеграция LLM для контекстной коррекции решает главную проблему CV-распознавания речи — гомофонные ошибки. Открытый код и локальная обработка делают решение привлекательным для корпоративного сектора, заботящегося о безопасности данных.

Источник: Github ↗