PineappleExpress808/auto-evaluator

Инструмент оценки для QA-цепочек LLM

Инструменты⭐ 1 103Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Инструмент для автоматизированной оценки качества цепочек ответов на вопросы (QA chains) на базе LangChain. Он генерирует тестовые вопросы из документов и оценивает ответы модели с помощью LLM.

Зачем нужен

Инструмент решает задачу быстрой валидации RAG-систем без ручного создания датасетов. Он автоматически извлекает вопросы и ответы из документов, запускает их через настроенную цепочку и использует LLM для сравнения результатов с эталоном, что позволяет объективно оценивать качество работы системы.

Что можно реализовать

  • Автоматическая генерация тестовых пар вопрос-ответ из загруженных документов
  • Сравнение эффективности различных конфигураций RAG-цепочек (разные методы сплита, эмбеддингов, ретриверы)
  • Оценка качества ответов LLM (например, GPT-3.5-turbo) относительно сгенерированных эталонов
  • Исследование влияния параметров (размер чанков, количество соседей) на точность ответов

Ключевые возможности

  • Автоматическая генерация набора данных для оценки (eval set) из исходных документов
  • Гибкая настройка параметров RAG: методы сплита текста, размер чанков, перекрытие, тип ретривера
  • Использование LLM для самопроверки и оценки ответов (grading) относительно эталона
  • Возможность запуска в виде Streamlit-приложения с графическим интерфейсом
  • Поддержка различных моделей LLM и эмбеддингов, включая возможность добавления моделей из Hugging Face

👤 Кому подойдёт: разработчики, работающие с LangChain и RAG-системами; исследователи, оценивающие качество LLM; инженеры по машинному обучению, настраивающие параметры извлечения знаний

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.