В эпоху, когда конфиденциальность данных становится критически важной, решение Transcriber предлагает альтернативу облачным сервисам. Это саморазмещаемое (self-hosted) веб-приложение с открытым исходным кодом позволяет транскрибировать YouTube-видео и локальные файлы (MP3, MP4, WAV) с помощью нейросетей Whisper, не отправляя ни байта данных на внешние серверы. Проект построен на стеке FastAPI (бэкенд) и Alpine.js + Tailwind CSS (фронтенд), обеспечивая современный интерфейс с поддержкой темной/светлой темы и адаптивным дизайном.
Два движка и умная оптимизация
Ключевое преимущество Transcriber — гибкость выбора AI-движка. Система автоматически определяет доступные ресурсы и предлагает два варианта обработки:
- openai-whisper: Стандартная модель с высокой точностью (используется по умолчанию при наличии FFmpeg).
- faster-whisper: Оптимизированная версия для молниеносного инференса, работающая как фоллбэк или основной движок.
Приложение поддерживает автоматическую установку FFmpeg (через скрипт install.py или imageio-ffmpeg), что устраняет необходимость ручной настройки зависимостей. Для пользователей NVIDIA GPU предусмотрена автоматическая активация CUDA (поддержка PyTorch с CUDA 12.4), что значительно ускоряет процесс расшифровки.
Технические характеристики и требования
Проект позиционируется как production-ready решение с использованием Docker (multi-stage build, non-root user). Ниже приведено сравнение ключевых параметров работы приложения:
| Параметр | Значение / Поддержка |
|---|---|
| Язык программирования | Python 3.10–3.12 (рекомендуется для GPU) |
| Бэкенд фреймворк | FastAPI, Uvicorn, WebSockets |
| Jinja2, Alpine.js, Tailwind CSS | |
| Работа с видео | yt-dlp (Python API), imageio-ffmpeg |
| Ускорение вычислений | NVIDIA CUDA (GPU) / CPU fallback |
| Безопасность файлов | Автоматическая санитизация имен файлов (специальные символы, акценты) |
| Лицензия | MIT License |
Почему это важно для разработчиков и энтузиастов
Transcriber решает сразу несколько болей пользователей локальных AI-инструментов. Во-первых, отсутствие подписок делает его бесплатным навсегда. Во-вторых, интеграция WebSockets позволяет отслеживать прогресс транскрипции в реальном времени, а не гадать, когда закончится обработка. В-третьих, встроенная «Smart Library» автоматически коррелирует загруженные медиафайлы с их текстовыми транскриптами, позволяя управлять историей и очищать пары файлов в один клик.
Для быстрого старта достаточно клонировать репозиторий, запустить python install.py для установки зависимостей и GPU-версии PyTorch, а затем выполнить uvicorn app.main:app. Приложение доступно по адресу http://localhost:8000. Также доступна готовая Docker-образная сборка, поддерживающая запуск с доступом к GPU через NVIDIA Container Toolkit.
Источник: Github ↗
