declare-lab/instruct-eval
This repository contains code to quantitatively evaluate instruction-tuned models such as Alpaca and Flan-T5 on held-out tasks.
Инструменты⭐ 553Python
Что это за инструмент
InstructEval — это инструмент для количественной оценки качества моделей, обученных на инструкциях (instruction-tuned), на независимых наборах данных.
Зачем нужен
Инструмент решает проблему сложного качественного сравнения моделей, позволяя проводить объективный бенчмаркинг. Он полезен для исследователей и разработчиков, которым нужно быстро и удобно измерить способность моделей обобщать знания на новых задачах, используя такие метрики, как MMLU, BBH, DROP и HumanEval.
Что можно реализовать
- Сравнение производительности различных instruction-tuned моделей (например, Alpaca, Flan-T5, LLaMA) на одних и тех же задачах.
- Оценка способности моделей к обобщению на сложных, ранее не встречавшихся задачах (held-out tasks).
- Использование в качестве базовой линии (baseline) для проверки новых или дообученных моделей перед их публикацией.
- Анализ результатов на специфических бенчмарках, таких как HumanEval для проверки навыков программирования.
Ключевые возможности
- Поддержка широкого спектра моделей HuggingFace Transformers, включая CausalLM, Seq2SeqLM, Llama и ChatGLM.
- Интеграция с академическими бенчмарками MMLU, BBH, DROP и HumanEval для комплексной оценки.
- Наличие публичного лидерборда (leaderboard) для отслеживания результатов и сравнения с другими моделями.
- Включает дополнительные модули для оценки безопасности (Red-Eval) и письменных навыков (IMPACT).
- Простота использования: код разработан для удобного и быстрого запуска тестирования на нескольких моделях.
👤 Кому подойдёт: исследователи, разработчики LLM, специалисты по машинному обучению
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.