vibrantlabsai/ragas

Ускорь оценки своих LLM-приложений 🚀

Инструменты⭐ 15 799Pythonпоследний релиз: v0.4.3
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Ragas — это инструмент для оценки и оптимизации приложений на базе LLM, предоставляющий объективные метрики и автоматическую генерацию тестовых наборов.

Зачем нужен

Инструмент решает проблему субъективной и трудоемкой проверки качества работы LLM-приложений, заменяя её на данные, основанные на метриках. Он полезен для создания эффективных рабочих процессов оценки, включая генерацию тестовых данных, выровненных с производственной средой, и построение циклов обратной связи для постоянного улучшения качества.

Что можно реализовать

  • Оценка систем RAG (Retrieval-Augmented Generation) с использованием готовых шаблонов
  • Кастомная оценка качества ответов LLM через DiscreteMetric (например, проверка точности сводок)
  • Автоматическая генерация тестовых датасетов для различных сценариев использования
  • Интеграция с LangChain и инструментами observability для мониторинга производительности

Ключевые возможности

  • Объективные метрики: использование как LLM-based, так и традиционных метрик для точной оценки
  • Генерация тестовых данных: автоматическое создание наборов данных, соответствующих производственным условиям
  • Готовые шаблоны: команда `ragas quickstart` позволяет быстро начать работу с проектами оценки
  • Простая интеграция: поддержка Python, pip-установка и совместимость с популярными фреймворками
  • Гибкая настройка: возможность создавать собственные метрики оценки для конкретных аспектов вывода LLM

👤 Кому подойдёт: разработчики LLM-приложений, инженеры по машинному обучению, специалисты по качеству AI-продуктов

Релизы

v0.4.3minor
🕐 8 мес назад · релиз на GitHub ↗

Релиз RAGAS v0.4.3: добавлен DSPyOptimizer с MIPROv2, поддержка системных промптов и кэширование DSPy.

  • Added: Добавлен DSPyOptimizer с MIPROv2 для продвинутой оптимизации промптов.
  • Added: Реализована поддержка системных промптов для InstructorLLM и LiteLLMStructuredLLM.
  • Added: Внедрено кэширование DSPy для ускорения работы.
  • Fixed: Исправлена проблема с сериализацией DiskCacheBackend для InstructorLLM.
  • Fixed: Включена языковая адаптация для метрики FactualCorrectness.