rlancemartin/auto-evaluator
Инструмент оценки для QA-цепочек LLM
Инструменты⭐ 1 103Python
Что это за инструмент
Инструмент для автоматизированной оценки качества цепочек вопросов и ответов (QA) на базе LangChain. Он генерирует тестовые данные и оценивает ответы LLM с помощью других моделей.
Зачем нужен
Позволяет быстро создавать наборы вопросов и ответов из документов и проверять, насколько хорошо RAG-система отвечает на них. Помогает сравнивать эффективность различных конфигураций цепочки (разбиение текста, методы поиска, модели) для выбора оптимальных параметров.
Что можно реализовать
- Автоматическая генерация тестовых пар вопрос-ответ из загруженных документов
- Сравнение качества ответов при разных методах разбиения текста (chunking) и поиска
- Оценка влияния выбора модели (LLM) на точность ответов в QA-цепочке
- Быстрый прототипинг и тестирование конфигураций RAG-систем через UI
Ключевые возможности
- Автоматическая генерация вопросов и ответов из документов с помощью GPT-3.5-turbo
- Встроенная оценка качества ответов (scoring) с использованием LLM
- Возможность сравнения результатов работы цепочки при разных конфигурациях
- Удобный интерфейс на базе Streamlit для настройки параметров
- Поддержка различных методов эмбеддинга и поиска (retriever_type)
👤 Кому подойдёт: разработчики, исследователи, инженеры по машинному обучению, работающие с LLM и RAG-системами
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.