Инструменты29 сентября 2026 г., 17:47 МСК🤖 Auto

KaigiAI: офлайн-перевод и стенография с Whisper и Llama

Открытый десктопный инструмент на Tauri/Rust для мгновенного перевода речи между 2–5 языками полностью локально, без отправки данных в облако.

Баннер новости 8518

Полная приватность и локальный стек

KaigiAI — это десктопное приложение, которое захватывает звук с микрофона и системного вывода (WASAPI loopback), распознает речь и переводит её в реальном времени. Ключевое отличие — работа полностью офлайн. Аудио и текст не покидают устройство, что критично для корпоративных переговоров и работы с конфиденциальной информацией. Приложение построено на стеке Tauri v2 + Rust + React 18, а интерфейс стилизован под Claude Desktop.

Технические детали и интеграция моделей

Программа использует whisper.cpp для распознавания речи (STT) и llama.cpp для генерации перевода. Серверы запускаются как дочерние процессы (sidecars) на локальных портах (8771 для whisper, 8770 для llama) и общаются с ядром по OpenAI-совместимому HTTP. Для слабых ПК предусмотрен опциональный режим работы через облачные API (Ollama, LM Studio, OpenAI), где ключи хранятся в нативном хранилище секретов ОС.

Сравнение конфигураций и требований к железу

Для локального режима пользователю необходимо самостоятельно скачать бинарники и веса моделей. Ниже приведена протестированная конфигурация для систем с NVIDIA GPU (CUDA 12.4) и базовые требования к ресурсам:

Компонент Рекомендуемая модель/версия Размер Требования к железу
STT (Распознавание) ggml-medium.bin (Whisper) ~1.5 ГБ Любой современный CPU/GPU
LLM (Перевод) qwen2.5-3b-instruct-q5_k_m.gguf ~2.3 ГБ 4–8 ГБ VRAM (GPU) или мощный CPU
Диаризация (опц.) wespeaker_en_voxceleb_resnet34_LM.onnx ~25 МБ Минимальное влияние на производительность
Высокое качество large-v3 (STT) + Qwen2.5-7B (LLM) ~3.5+ ГБ 16+ ГБ VRAM (NVIDIA)

Функциональные возможности

  • Мультиязычность: Поддержка перевода между 2 языками (параллельные панели) и 3–5 языками (сетка колонок).
  • Диаризация: Опциональное распознавание спикеров с метками «Speaker N» и возможностью переименования на основе ONNX-эмбеддингов.
  • Экспорт: Сохранение истории в SQLite, экспорт транскриптов и аудио-клипов в Markdown, PDF или ZIP.
  • Интерфейс: 14 языков локализации, поддержка заметок и AI-саммари бесед.

Установка и запуск

Программа распространяется под лицензией MIT. Для сборки из исходников требуются Node.js 18+, Rust (stable) и MSVC build tools. Релизные сборки (portable .exe, NSIS, MSI) собираются командой npm run tauri build. Пользователю нужно лишь указать пути к скачанным бинарникам whisper-server.exe и llama-server.exe в настройках приложения, после чего KaigiAI автоматически управляет их запуском и health-check.

Источник: Github ↗