jianchang512/pyvideotrans

Перевод видео с одного языка на другой с наложением дубляжа и субтитров.

Мультимодальные⭐ 19 106Pythonпоследний релиз: v4.13
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

pyVideoTrans — это инструмент с открытым исходным кодом для автоматического перевода видео, генерации субтитров и создания AI-озвучки (дубляжа) с поддержкой клонирования голоса.

Зачем нужен

Инструмент решает задачу полной локализации видеоконтента: от распознавания речи (ASR) и перевода текста до синтеза новой аудиодорожки (TTS) и синхронизации с видео. Он полезен создателям контента и локализаторам, так как позволяет использовать как локальные модели (например, Faster-Whisper, Ollama), так и облачные API (OpenAI, Azure, DeepSeek), обеспечивая гибкость между бесплатными и платными решениями.

Что можно реализовать

  • Автоматический перевод обучающих видео или подкастов на другой язык с наложением новой озвучки.
  • Массовая генерация SRT-субтитров для аудио/видео файлов с распознаванием разных спикеров (Speaker Diarization).
  • Создание дубляжа с использованием клонирования голоса (Zero-shot voice cloning) через модели F5-TTS, CosyVoice или GPT-SoVITS.
  • Пакетная обработка видео на сервере через CLI или Docker без графического интерфейса.

Ключевые возможности

  • Полный автоматизированный пайплайн: ASR → перевод → TTS → сборка видео.
  • Поддержка широкого спектра моделей: локальные (Faster-Whisper, Ollama) и облачные (OpenAI, Azure, Google, DeepSeek).
  • Возможность ручного редактирования и проверки на каждом этапе (распознавание, перевод, озвучка).
  • Клонирование голоса (Voice Cloning) для создания персонализированной озвучки.
  • Гибкие способы запуска: GUI, CLI, WebUI и Docker.

👤 Кому подойдёт: разработчики, создатели контента (контент-мейкеры), локализаторы видео, технические специалисты, работающие с автоматизацией обработки медиа.

Релизы

v4.13minor
🕐 2 дн назад · релиз на GitHub ↗

Релиз v4.13: улучшена стабильность Whisper, добавлена поддержка новых AI-провайдеров и角色的 для Dubao TTS 2.0.

  • Added: Расширена поддержка моделей распознавания, перевода и синтеза для SiliconFlow, Minimax и OpenRouter.
  • Added: Добавлены новые голоса для синтеза речи Dubao TTS 2.0.
  • Fixed: Улучшен алгоритм переанализа и разбивки предложений после работы Whisper.
  • Fixed: Добавлена кнопка паузы в функции объединения медиафайлов.
  • Fixed: Оптимизирована загрузка моделей: при сбое теперь выполняется автоматическая повторная попытка.
  • Added: Переработано окно настроек и структура меню для упрощения добавления новых каналов.
v4.12minorbreaking
🕐 16 дн назад · релиз на GitHub ↗

v4.12: LLM теперь только для纠错, VAD улучшен, вторичное распознавание на faster-whisper large-v3-turbo, добавлен автодетект языка.

  • Breaking: Функция «LLM-перефразирование» заменена на «LLM-коррекцию»: теперь ИИ исправляет только опечатки и пунктуацию, не меняя структуру предложений.
  • Added: Вторичное распознавание речи жестко привязано к движку faster-whisper (по умолчанию модель large-v3-turbo) для лучшей совместимости.
  • Added: Улучшен алгоритм сегментации аудио на основе VAD.
  • Added: В выпадающем списке языков для озвучки видео добавлена опция «Автоопределение».
  • Fixed: Исправлены различные ошибки и удалены устаревшие функции (предварительное разделение whisper, слияние коротких субтитров).
v4.11minor
🕐 1 мес назад · релиз на GitHub ↗

PyVideoTrans v4.11: добавлена поддержка LiteLLM, управление Thinking для AI-переводов, веб-интерфейс для TTS API и новые языки.

  • Added: Добавлен провайдер LiteLLM для расширения возможностей AI-переводов.
  • Added: Реализована настройка параметра Thinking для нескольких каналов AI-перевода.
  • Added: Кастомное TTS API теперь доступно через веб-интерфейс.
  • Added: Встроенная поддержка языков узбекского (uz) и болгарского (bg).
  • Added: Упрощен процесс самостоятельного добавления новых языков и голосов.
  • Fixed: Исправлены различные известные ошибки.
v4.10minor
🕐 1 мес назад · релиз на GitHub ↗

Добавлена поддержка FireRedTTS3 и Index-tts 2.5, улучшен интерфейс редактирования субтитров, исправлен перевод через Microsoft Edge.

  • Added: Добавлена поддержка моделей синтеза речи FireRedTTS3 и Index-tts 2.5.
  • Added: Улучшен интерфейс редактирования субтитров в режиме работы с одним видео.
  • Fixed: Исправлена ошибка перевода через Microsoft Edge после удаления конечной точки аутентификации.
  • Added: Добавлена поддержка Nix flake для удобного управления зависимостями.
v4.09majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

Добавлены модели Moss-Transcribe-Diarize, ARK-ASR, Granite-Speech и Higgs-TTS; Microsoft Translate заменен на M2M100; F5-TTS получил поддержку вьетнамского и турецкого.

  • Breaking: Сервис Microsoft Translate больше не работает; при ошибках автоматически используется локальная модель M2M100.
  • Added: В распознавание речи добавлена модель Moss-Transcribe-Diarize с поддержкой диаризации для видео до 90 минут.
  • Added: Канал Huggingface_ASR пополнился моделями Audio8/ARK-ASR-0.6B и ibm-granite/granite-speech-4.1-2b.
  • Added: Добавлена поддержка TTS-модели higgs-audio-v3-tts-4b (требует 10G+ VRAM для CUDA или 20G+ RAM для CPU).
  • Added: F5-TTS расширен поддержкой вьетнамского и турецкого языков.
  • Fixed: Возвращена кнопка импорта локальных субтитров на исходном языке (работает только в режиме одного видео).
v4.08minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v4.08: исправление багов, оптимизация whisper.cpp и UI, новые функции для управления задачами.

  • Fixed: Исправлена ошибка, из-за которой субтитры могли оставаться пустыми при отсутствии выбранной озвучки.
  • Added: В Windows-версии встроен движок whisper.cpp.
  • Added: При пакетном переводе видео добавлена возможность удаления отдельных задач.
  • Fixed: Улучшена работа с загрузкой моделей.
  • Fixed: Оптимизирован процесс редактирования субтитров и повторного озвучивания в режиме одиночного видео.
v4.05minor
🕐 2 мес назад · релиз на GitHub ↗

OmniVoice стал встроенным компонентом, добавлена поддержка ASR mimo-v2.5-asr и локального перевода Hy-MT2-1.8B, исправлен Qwen-TTS.

  • Added: OmniVoice интегрирован в ядро приложения как встроенная функция.
  • Added: Добавлена поддержка модели распознавания речи Xiaomi mimo-v2.5-asr.
  • Added: В канал локального перевода субтитров добавлена модель Hy-MT2-1.8B.
  • Fixed: Исправлена работа движка синтеза речи Qwen-TTS.
v4.04major
🕐 2 мес назад · релиз на GitHub ↗

Релиз v4.04: F5-TTS стал встроенным, добавлены новые модели распознавания и синтеза речи, обновлён piper-tts и исправлены ошибки.

  • Added: Модель синтеза речи F5-TTS интегрирована в состав программы как встроенная.
  • Added: Добавлены новые каналы распознавания: Firered中文, Dohpin, parakeet и Omnilingual.
  • Added: Появился новый канал синтеза речи ZipVoice (англо-китайский, работает локально).
  • Added: Выполнено обновление движка синтеза речи piper-tts.
  • Fixed: Устранена ошибка, приводившая к потере последних слов при озвучивании.
  • Fixed: Исправлены проблемы с работой канала WhisperX-API.