openai/evals

Evals — это фреймворк для оценки LLM и LLM-систем, а также открытый реестр бенчмарков.

Инструменты⭐ 19 489Pythonпоследний релиз: v0.1.1
Открыть на GitHub ↗

Что это за инструмент

OpenAI Evals — это фреймворк для оценки качества LLM и систем на их основе, а также открытый реестр бенчмарков.

Зачем нужен

Инструмент позволяет измерять, как различные версии моделей влияют на конкретные use-case, что критически важно для контроля качества. Он предоставляет готовые бенчмарки для тестирования OpenAI моделей и поддерживает создание пользовательских evals на основе собственных данных без их публичной публикации.

Что можно реализовать

  • Тестирование производительности новых версий LLM на специфичных для бизнеса данных
  • Создание приватных evals для проверки паттернов работы LLM в корпоративном workflow
  • Использование готовых бенчмарков из реестра для базовой оценки моделей
  • Оценка систем с использованием RAG или агентов через Completion Function Protocol

Ключевые возможности

  • Открытый реестр готовых evals для тестирования различных аспектов моделей
  • Возможность создания кастомных evals с использованием собственных данных
  • Интеграция с OpenAI Dashboard для конфигурации и запуска
  • Поддержка логирования результатов в Snowflake
  • Возможность создания evals через YAML без написания кода (для базовых сценариев)

👤 Кому подойдёт: разработчики LLM-систем, ML-инженеры, исследователи

Релизы