confident-ai/deepeval

Фреймворк для оценки LLM

Инструменты⭐ 18 361Pythonпоследний релиз: python-v4.2.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

DeepEval — это фреймворк для оценки качества работы LLM-систем, работающий по принципу pytest, но специализированный для юнит-тестирования приложений на базе больших языковых моделей.

Зачем нужен

Инструмент позволяет автоматически проверять качество ответов LLM, выявлять галлюцинации и оценивать выполнение задач с помощью метрик (например, G-Eval, LLM-as-a-judge) и локальных NLP-моделей. Это помогает оптимизировать модели, промпты и архитектуру, предотвращать дрейф промптов и безопасно мигрировать между провайдерами (например, с OpenAI на Claude).

Что можно реализовать

  • Юнит-тестирование и валидация RAG-пайплайнов (проверка релевантности ответов и фактологической точности)
  • Оценка работы AI-агентов (проверка корректности использования инструментов, соблюдения плана и завершения задач)
  • Сравнение эффективности различных LLM и промптов для выбора оптимальной конфигурации
  • Автоматизация регрессионного тестирования при обновлении моделей или изменении логики приложения

Ключевые возможности

  • Поддержка широкого спектра метрик: от G-Eval и DAG до специфичных метрик для агентов и RAG
  • Гибкость выбора бэкенда: можно использовать любую LLM или локальные NLP-модели
  • Интеграция с популярными фреймворками, такими как LangChain и OpenAI
  • Возможность создания пользовательских метрик под специфические критерии оценки
  • Интеграция с платформой Confident AI для хранения данных тестов и генерации отчетов

👤 Кому подойдёт: разработчики AI-приложений, ML-инженеры, исследователи, работающие с LLM, RAG и агентами

Релизы

python-v4.2.0minor
🕐 27 дн назад · релиз на GitHub ↗

Релиз 4.2.0: поддержка MCP, Vertex AI, голосовых функций, рефакторинг DAG-метрик и исправление подсчёта токенов.

  • Added: Добавлена поддержка MCP-серверов, учёт учётных данных для Vertex AI и голосовых функций.
  • Added: Реализована поддержка SDK для обновления и удаления золотых наборов данных, а также рефакторинг DAG-метрик.
  • Fixed: Исправлен подсчёт токенов и скоринг в LLM-спанах, а также сериализация вызовов инструментов.
  • Fixed: Устранены проблемы с маршрутизацией бэкенда, валидацией DAG-графов и корректным ответом в тестах MathQA.
python-v4.1.9minor
🕐 1 мес назад · релиз на GitHub ↗

Добавлена синхронная и асинхронная отправка трасс, улучшена интеграция с Bedrock и исправлены ошибки в документации.

  • Added: Добавлена синхронная и асинхронная отправка трасс (traces).
  • Added: В метрики вызовов инструментов добавлено поле type.
  • Fixed: Исправлена работа OpenTelemetry: атрибуты теперь мутабельны.
  • Fixed: Устранены опечатки в интеграции Bedrock и туториале по RAG QA.
  • Added: Запущен мастер-помощник Deepeval wizard для упрощения настройки.
v4.1.7patch
🕐 1 мес назад · релиз на GitHub ↗

В Deepeval v4.1.7 добавлен флаг flaky для тестов и исправлено парсинг системных инструкций.

  • Added: Добавлен флаг flaky для метрик и тест-кейсов для маркировки нестабильных проверок.
  • Fixed: Исправлено парсинг системных инструкций.
  • Fixed: Исправлено рекурсивное добавление additionalProperties в схемах шлюза (gateway).
v4.1.5minor
🕐 1 мес назад · релиз на GitHub ↗

Добавлен флаг flaky для метрик и тест-кейсов, исправлено парсинг системных инструкций и рекурсивная настройка additionalProperties.

  • Added: Добавлен флаг flaky для пометки нестабильных метрик и тест-кейсов.
  • Fixed: Исправлено парсинг системных инструкций.
  • Fixed: Исправлено рекурсивное задание additionalProperties для схем шлюза.
v4.0.5minor
🕐 3 мес назад · релиз на GitHub ↗

Добавлена поддержка модели claude-opus-4-8 с мультимодальностью, структурированным выводом и обновлёнными тарифами.

  • Added: Добавлен пресет для модели claude-opus-4-8, включая поддержку мультимодальности и структурированного вывода.
  • Added: Обновлены метаданные с ценовой информацией для модели claude-opus-4-8.