PineappleExpress808/auto-evaluator
Инструмент оценки для QA-цепочек LLM
Инструменты⭐ 1 103Python
Что это за инструмент
Инструмент для автоматизированной оценки качества цепочек ответов на вопросы (QA chains) на базе LangChain. Он генерирует тестовые вопросы из документов и оценивает ответы модели с помощью LLM.
Зачем нужен
Инструмент решает задачу быстрой валидации RAG-систем без ручного создания датасетов. Он автоматически извлекает вопросы и ответы из документов, запускает их через настроенную цепочку и использует LLM для сравнения результатов с эталоном, что позволяет объективно оценивать качество работы системы.
Что можно реализовать
- Автоматическая генерация тестовых пар вопрос-ответ из загруженных документов
- Сравнение эффективности различных конфигураций RAG-цепочек (разные методы сплита, эмбеддингов, ретриверы)
- Оценка качества ответов LLM (например, GPT-3.5-turbo) относительно сгенерированных эталонов
- Исследование влияния параметров (размер чанков, количество соседей) на точность ответов
Ключевые возможности
- Автоматическая генерация набора данных для оценки (eval set) из исходных документов
- Гибкая настройка параметров RAG: методы сплита текста, размер чанков, перекрытие, тип ретривера
- Использование LLM для самопроверки и оценки ответов (grading) относительно эталона
- Возможность запуска в виде Streamlit-приложения с графическим интерфейсом
- Поддержка различных моделей LLM и эмбеддингов, включая возможность добавления моделей из Hugging Face
👤 Кому подойдёт: разработчики, работающие с LangChain и RAG-системами; исследователи, оценивающие качество LLM; инженеры по машинному обучению, настраивающие параметры извлечения знаний
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.