typpo/promptfoo

Тестируйте промпты, агентов и RAG. Пентестинг и сканирование уязвимостей для AI. Сравнивайте производительность GPT, Claude, Gemini, DeepSeek и других. Простые декларативные конфиги с интеграцией в CLI и CI/CD. Используется OpenAI и Anthropic.

Инструменты⭐ 25 318TypeScriptпоследний релиз: 0.123.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Promptfoo — это CLI-инструмент и библиотека для оценки качества (evals) и тестирования на безопасность (red teaming) приложений с LLM.

Зачем нужен

Инструмент позволяет заменить метод проб и ошибок на измеримые метрики при разработке AI-приложений. Он помогает сравнивать производительность разных моделей, выявлять уязвимости и обеспечивать стабильность работы RAG и агентов.

Что можно реализовать

  • Сравнение ответов GPT, Claude, Gemini и других моделей в едином интерфейсе
  • Автоматизированное тестирование промптов и RAG-систем через CI/CD
  • Поиск уязвимостей и проведение red teaming для защиты LLM-приложений
  • Анализ безопасности кода, связанного с LLM, через code scanning

Ключевые возможности

  • Поддержка множества провайдеров: OpenAI, Anthropic, Azure, Bedrock, Ollama и других
  • Полностью локальное выполнение evals для конфиденциальности данных
  • Простая декларативная конфигурация и интеграция с CI/CD
  • Встроенный просмотр результатов в виде веб-интерфейса и CLI
  • Open source лицензия MIT и активное сообщество

👤 Кому подойдёт: разработчики AI-приложений, DevOps-инженеры, специалисты по безопасности (security researchers)

Релизы

0.123.1minor
🕐 3 дн назад · релиз на GitHub ↗

Добавлена поддержка Gemini 3.8, GPT-Live, OpenAI Agents API и MCP; улучшена стабильность assertions и CLI.

  • Added: Добавлены провайдеры Gemini 3.8, Vertex Live, GPT-Live voice sessions, OpenAI Agents API и портативные схемы конфигурации MCP/HTTP.
  • Added: Поддержка Ollama 0.34: отображение мыслей (thinking output), причин завершения и обновление документации моделей.
  • Added: Обновлены инструменты и поддержка медиа для Gemini; обновлена аутентификация для AWS Bedrock.
  • Fixed: Исправлены ошибки парсинга tool calls, инверсии оценок в search-rubric и некорректных значений по умолчанию для RAG-assertions.
  • Fixed: Устранены проблемы с экспортом больших результатов, сохранением данных в памяти для расширений и обработкой некорректных вебхуков.
0.123.0majorbreaking
🕐 11 дн назад · релиз на GitHub ↗

Добавлена поддержка GPT-6, Grok-4.6 и Gemini 3.8 Flash. По умолчанию GPT-5.6+ использует Responses API.

  • Breaking: Провайдеры GPT-5.6 и выше теперь по умолчанию используют Responses API вместо Chat Completions.
  • Added: Добавлена поддержка новых моделей: GPT-6 Astra, GPT Image 2.5, GPT Transcribe, Claude Fable, Mythos 5.1, Muse Spark 1.3, Gemini 3.8 Flash, Grok-4.6 и генеративных Grok.
  • Added: В метаданные ответов добавлены вызовы инструментов MCP; добавлена оценка аудио через assertion llm-rubric.
  • Fixed: Исправлено распознавание function_call в OpenAI Responses, сохранение окружения для stdio MCP-серверов и защита записей БД при сбоях.
code-scan-action-0.2.0majorbreaking
🕐 24 дн назад · релиз на GitHub ↗

Выпуск 0.2.0: прекращена поддержка Node.js 20, усилены меры безопасности supply chain и обновлены зависимости.

  • Breaking: Полностью прекращена поддержка Node.js 20.
  • Fixed: Усилены меры безопасности цепочки поставок для code-scan action.
  • Fixed: Исправлена уязвимость в зависимости undici и защищены lock-файлы.
  • Fixed: Обновлены типы TypeScript.
0.122.1minor
🕐 25 дн назад · релиз на GitHub ↗

Релиз 0.122.1: улучшено отслеживание токенов, добавлена поддержка Gemini 3.7 Flash и расширены возможности трассировки.

  • Added: Добавлена поддержка моделей Gemini 3.7 Flash и Flash-Lite.
  • Added: Значительно расширены возможности трассировки: добавлена интеграция с Grafana Tempo, Braintrust, Langfuse, а также поддержка OpenTelemetry GenAI, OpenAI Agents и Vercel SDK.
  • Added: Улучшено отслеживание затрат: теперь можно различать объем сканирования и фактическое потребление токенов, а также учитывать токены в многошаговых атаках и отчетах.
  • Fixed: Исправлены ошибки в ассертах: устранено обратное переключение в GLEU и SQL, исправлены сообщения об ошибках JSON и скоринг GLEU без токенов.
  • Fixed: Устранены проблемы с зависимостями: заблокированы скрипты установки в Docker, синхронизирован генератор CST Chevrotain и упакован кэш.
0.122.0majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

Выпуск 0.122.0: прекращена поддержка Node.js 20, устранены уязвимости в зависимостях и исправлены ошибки провайдеров.

  • Breaking: Удалена поддержка Node.js 20.
  • Fixed: Устранены уязвимости в зависимостях undici, socket.io-parser и Biome.
  • Fixed: Исправлено зависание WebSocket-оценок при остановке потока.
  • Fixed: Устранена утечка настроек провайдера Nscale в тело запроса.
  • Fixed: Восстановлено декодирование XML-сущностей для файлов тестов xlsx.
0.121.20minor
🕐 1 мес назад · релиз на GitHub ↗

Добавлена поддержка Claude Opus 5, Kimi K3 и новых моделей Azure/Gemini; улучшена изоляция контекста и стабильность провайдеров.

  • Added: Добавлена поддержка Claude Opus 5, Kimi K3 (Moonshot), а также актуальных моделей Azure, Claude и Gemini.
  • Added: Реализована поддержка URL-шаблонизации для WebSocket-соединений.
  • Fixed: История диалогов теперь изолируется по колонкам результатов, исключая коллизии индексов промптов.
  • Fixed: Исправлен краш Azure при пустых ответах, обновлены пакеты Anthropic и js-yaml (безопасность).
  • Fixed: Улучшена доступность отчетов Red Team, мигрирован Langfuse на SDK v5 и починены ошибки гидратации сайта.
code-scan-action-0.1.8patch
🕐 3 мес назад · релиз на GitHub ↗

Исправлена обработка смешанных ответов в code-scan и обновлена поддержка Node 24.

  • Fixed: Исправлена обработка результатов сканирования кода при смешанных ответах с пропуском.
  • Fixed: GitHub Action теперь работает на среде выполнения Node 24.