AIKraft/Skills/Речевой движок

Речевой движок

Add real-time voice conversations to a custom agent runtime with ElevenLabs Speech Engine. Use when building Speech Engine servers, WebSocket handlers, WebRTC browser clients, conversation token endpoints, interruption-aware streaming responses, or voice-enabled chat agents that connect developer-owned server logic to ElevenLabs speech-to-text and text-to-speech.

elevenlabs official Разработка

Что делает навык

Добавляет голосовой интерфейс в кастомный рантайм агента, где ElevenLabs обрабатывает аудио, распознавание речи, управление очередью реплик и синтез, а сервер разработчика предоставляет WebSocket-эндпоинт и потоковую передачу текста. Решает задачу интеграции голосового взаимодействия в существующие приложения или серверные пайплайны с сохранением логики агента на стороне разработчика.

Когда применять

  • Добавление голоса в существующее чат-приложение или пользовательский серверный пайплайн
  • Интеграция голоса в OpenClaw, Hermes или аналогичные рантаймы агентов с сохранением логики на сервере разработчика
  • Создание WebSocket-сервера для голосовых бесед на стороне разработчика
  • Потоковая передача текстового ответа в виде аудио после проверки намерения пользователя на сервере
  • Обработка прерываний пользователя во время потоковой отправки ответа

Как работает

  1. Настроить окружение, используя пакеты @elevenlabs/* для JavaScript или соответствующие SDK для Python
  2. Создать и развернуть серверный WebSocket-эндпоинт для обработки голосовых бесед
  3. Сгенерировать токон разговора (conversation token) на сервере для использования в браузере
  4. Настроить браузерного клиента с использованием @elevenlabs/react или @elevenlabs/client
  5. Обеспечить потоковую передачу текста ответа от сервера обратно в клиент для синтеза речи
  6. Реализовать логику обработки прерываний пользователя во время воспроизведения ответа

Примеры запросов агенту

Добавь голосовой интерфейс к моему существующему чат-приложению, используя ElevenLabs Speech Engine
Настрой WebSocket-сервер для голосовых бесед с моим кастомным агентом на Python
Интегрируй голос в мой рантайм OpenClaw, оставив логику агента на моем сервере

Что понадобится

  • Ключи API ElevenLabs
  • Пакеты @elevenlabs/* (для JavaScript) или соответствующие SDK (для Python)
  • Серверное окружение для размещения WebSocket-эндпоинта

Описание составлено по SKILL.md навыка, сверено 06.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «speech-engine» из репозитория: # https://github.com/elevenlabs/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r speech-engine/ ~/.claude/skills/speech-engine/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.