rlancemartin/auto-evaluator

Инструмент оценки для QA-цепочек LLM

Инструменты⭐ 1 103Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Инструмент для автоматизированной оценки качества цепочек вопросов и ответов (QA) на базе LangChain. Он генерирует тестовые данные и оценивает ответы LLM с помощью других моделей.

Зачем нужен

Позволяет быстро создавать наборы вопросов и ответов из документов и проверять, насколько хорошо RAG-система отвечает на них. Помогает сравнивать эффективность различных конфигураций цепочки (разбиение текста, методы поиска, модели) для выбора оптимальных параметров.

Что можно реализовать

  • Автоматическая генерация тестовых пар вопрос-ответ из загруженных документов
  • Сравнение качества ответов при разных методах разбиения текста (chunking) и поиска
  • Оценка влияния выбора модели (LLM) на точность ответов в QA-цепочке
  • Быстрый прототипинг и тестирование конфигураций RAG-систем через UI

Ключевые возможности

  • Автоматическая генерация вопросов и ответов из документов с помощью GPT-3.5-turbo
  • Встроенная оценка качества ответов (scoring) с использованием LLM
  • Возможность сравнения результатов работы цепочки при разных конфигурациях
  • Удобный интерфейс на базе Streamlit для настройки параметров
  • Поддержка различных методов эмбеддинга и поиска (retriever_type)

👤 Кому подойдёт: разработчики, исследователи, инженеры по машинному обучению, работающие с LLM и RAG-системами

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.