pipecat-ai/pipecat

Open Source framework для голосовых агентов, мультимодальных приложений и AI в реальном времени. Поддерживается Daily и сообществом.

Агенты⭐ 15 702Pythonпоследний релиз: v1.11.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Pipecat — это open-source Python-фреймворк для создания голосовых и мультимодальных AI-агентов с ультра-низкой задержкой в реальном времени.

Зачем нужен

Инструмент позволяет строить сложные конвейеры (pipelines) для обработки аудио, видео и текста, объединяя сервисы распознавания речи, TTS и LLM. Он полезен для разработки интерактивных приложений, где критична скорость отклика и возможность координации работы нескольких агентов.

Что можно реализовать

  • Голосовые ассистенты с естественным потоковым диалогом
  • Мультимодальные интерфейсы, обрабатывающие голос, видео и изображения
  • Системы с несколькими агентами (multi-agent), где специалисты передают задачи друг другу или работают параллельно
  • Бизнес-боты для сбора информации, поддержки клиентов и проведения встреч
  • Интерактивное сторителлинг и генеративные медиа-приложения

Ключевые возможности

  • Поддержка мультиагентных систем с передачей контроля (handoff) и параллельным выполнением задач
  • Встроенные структурированные диалоги (Pipecat Flows) с управлением состоянием
  • Готовые клиентские SDK для JS, React, React Native, iOS, Android, C++ и ESP32
  • Интеграция с AI-ассистентами кода (например, Claude Code) для быстрого старта проектов через CLI
  • Низкая задержка благодаря поддержке WebSockets и WebRTC транспортов

👤 Кому подойдёт: Разработчики Python, создающие AI-приложения; команды, разрабатывающие голосовых ботов и мультимодальные интерфейсы; исследователи в области real-time AI-агентов

Релизы

v1.11.0minor
🕐 3 дн назад · релиз на GitHub ↗

Pipecat v1.11.0: видео в LiveKit, тонкая настройка STT/TTSS, поддержка Saaras v4 и Groq reasoning.

  • Added: LiveKitTransport теперь поддерживает вывод видео (камера) с настраиваемым кодеком и битрейтом.
  • Added: Добавлена поддержка модели Saaras v4 в SarvamRealtimeSTTService.
  • Added: GroqLLMService получил поле reasoning_effort для контроля усилий рассуждения и скрытия мыслей Qwen.
  • Added: Расширены настройки STT: задержка в OpenAI, ключевые слова, стабильность AWS, начальный промпт Whisper.
  • Added: AzureTTSService поддерживает аудиоэффекты, SmallestTTSService — чтение математических формул.
  • Added: Улучшены скриптовые тесты: оценка function_call через judge, проверка маркеров завершения LLM.
v1.10.0majorbreaking
🕐 9 дн назад · релиз на GitHub ↗

Переход на OpenAI 3 и Anthropic 1 SDK, новый Speechmatics Agent STT, улучшенная работа Smallest TTS и Gradium VAD.

  • Breaking: Обновлены зависимости: теперь поддерживаются OpenAI 3 (на базе httpx2) и Anthropic 1 SDK, что требует пересборки TLS-сертификатов и явного указания региона для Bedrock.
  • Breaking: SpeechmaticsSTTService переключен на новый Agent STT API (/v2/agent), старый real-time endpoint больше не поддерживается, изменены настройки обнаружения реплик и модели.
  • Added: SmallestTTSService использует continuation API для сохранения просодии в рамках одного хода LLM, добавлена настройка буферизации max_buffer_delay_ms.
  • Added: GradiumSTTService получил серверное обнаружение конца реплик (turn detection), позволяющее передавать управление VAD на сторону сервера.
  • Added: LiveKitParams получил настройку размера буфера исходящего аудио, а SpeechmaticsSTTService добавил автоматическое переподключение с экспоненциальной задержкой.
v1.9.0minor
🕐 10 дн назад · релиз на GitHub ↗

Детальная аналитика задержек, поддержка аудио в тестах, новый AssemblyAI STT, улучшения Azure/Deepgram и Eval-фреймворка.

  • Added: Добавлен LatencyBreakdown.contributions для детальной разбивки задержек по этапам и настройкам.
  • Added: Появился AssemblyAISyncSTTService для транскрипции через Sync API AssemblyAI.
  • Added: В сценариях тестирования (Eval) теперь можно использовать аудиофайлы вместо синтеза речи.
  • Added: Добавлены обработчики on_progress и on_update для отслеживания состояния Eval-сессий.
  • Added: Улучшены настройки Azure TTS/STT и Deepgram Flux (фильтр нецензурной лексики, версионирование моделей).
v1.8.1patch
🕐 24 дн назад · релиз на GitHub ↗

Исправлено распознавание .yml-файлов в pipecat eval run и устранена ошибка с предупреждениями Context Hub в pipecat init.

  • Fixed: Команда pipecat eval run теперь корректно обрабатывает .yml-файлы в директориях, дополняя поддержку .yaml.
  • Fixed: Исправлена ошибка в pipecat init, из-за которой повторно предлагалось создать существующий индекс Context Hub и не появлялось предупреждение о неактуальности.
v1.8.0minor
🕐 25 дн назад · релиз на GitHub ↗

Pipecat v1.8.0: добавлен Context Hub, улучшена работа с MCP и Gemini, обновлён Google STT.

  • Added: Встроен Context Hub в CLI для управления знаниями агентов с автоматической проверкой актуальности.
  • Added: Упрощена интеграция MCP: добавлен метод tools() для автоматической регистрации инструментов.
  • Added: Появился KeenableWebSearch для голосовых агентов с поиском по веб-страницам через MCP.
  • Added: Gemini-адаптер теперь поддерживает внешние изображения по URL через Part.from_uri().
  • Added: Google STT v2 получил поддержку адаптации фраз для учета доменной лексики.
  • Added: Добавлены фреймы ProposedUserStartedSpeakingFrame для гибкого управления переключением реплик.
v1.7.0minor
🕐 1 мес назад · релиз на GitHub ↗

Добавлены метрики использования для LLM и STT, улучшена настройка ElevenLabs, Deepgram, AssemblyAI и Google Gemini.

  • Added: Добавлены метрики использования токенов для AWS Nova Sonic и метрики длительности аудио для всех STT-сервисов.
  • Added: В ElevenLabs STT добавлена фильтрация фонового шума, а в Deepgram Flux — конвертация чисел в цифры.
  • Added: Для AssemblyAI добавлена поддержка множественных языков, а для Google Gemini — явные настройки безопасности.
  • Added: В LiveKit добавлена поддержка входящих DTMF-сигналов, а в HTTP-клиенты сервисов — параметр кастомного клиента.