AIKraft/Skills/Производство говорящей головы

Производство говорящей головы

Talking head video production with AI avatars, lipsync, and voiceover. Recommended: P-Video-Avatar (fastest, cheapest, built-in TTS). Also covers OmniHuman, PixVerse, Fabric. Portrait requirements, audio quality, production workflows. Use for: spokesperson videos, course content, social media, presentations, demos. Triggers: talking head, avatar video, lipsync, lip sync, ai spokesperson, virtual p

inference-sh official Документы

Что делает навык

Создание видео с говорящей головой (аватаром) с использованием AI-липсинка и озвучки. Позволяет анимировать портретное изображение под голосовой скрипт или аудиофайл, поддерживая встроенный TTS и мультиязычность.

Когда применять

  • Создание видео-представителей (AI spokesperson) для презентаций и демо
  • Генерация учебного контента и обучающих материалов
  • Создание контента для социальных сетей
  • Локализация и дубляж существующих видео на другие языки

Как работает

  1. Установить CLI-инструмент belt: npx skills add belt-sh/cli и выполнить авторизацию belt login
  2. Подготовить портретное изображение (лицо по центру, вид по плечи, нейтральное выражение, высокое разрешение) или сгенерировать его через pruna/p-image
  3. Выбрать модель: pruna/p-video-avatar для скорости и встроенного TTS, или bytedance/omnihuman-1-5 для мультиперсонажности
  4. Запустить генерацию видео через belt app run, передав URL изображения, скрипт (voice_script) или аудиофайл (audio)
  5. Для длинных видео разбить сценарий на сегменты, сгенерировать клипы отдельно и объединить их через infsh/media-merger

Примеры запросов агенту

Создай видео с говорящей головой, используя портрет по ссылке https://portrait.jpg и встроенный голос Zephyr для текста: 'Welcome to our product tour.'
Сгенерируй мультиперсонажный диалог с помощью bytedance/omnihuman-1-5, где два персонажа обсуждают новую функцию аналитики
Сделай липсинк для существующего видео https://original-video.mp4, используя переведенный аудиофайл https://new-audio.mp3

Что понадобится

  • Установленный и авторизованный CLI belt (npx skills add belt-sh/cli)
  • Доступ к API inference.sh (требуется аккаунт и авторизация belt login)
  • Портретное изображение в формате, соответствующем требованиям (минимум 512x512, лицо по центру)

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «talking-head-production» из репозитория: # https://github.com/inference-sh/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r talking-head-production/ ~/.claude/skills/talking-head-production/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.