declare-lab/instruct-eval

This repository contains code to quantitatively evaluate instruction-tuned models such as Alpaca and Flan-T5 on held-out tasks.

Инструменты⭐ 553Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

InstructEval — это инструмент для количественной оценки качества моделей, обученных на инструкциях (instruction-tuned), на независимых наборах данных.

Зачем нужен

Инструмент решает проблему сложного качественного сравнения моделей, позволяя проводить объективный бенчмаркинг. Он полезен для исследователей и разработчиков, которым нужно быстро и удобно измерить способность моделей обобщать знания на новых задачах, используя такие метрики, как MMLU, BBH, DROP и HumanEval.

Что можно реализовать

  • Сравнение производительности различных instruction-tuned моделей (например, Alpaca, Flan-T5, LLaMA) на одних и тех же задачах.
  • Оценка способности моделей к обобщению на сложных, ранее не встречавшихся задачах (held-out tasks).
  • Использование в качестве базовой линии (baseline) для проверки новых или дообученных моделей перед их публикацией.
  • Анализ результатов на специфических бенчмарках, таких как HumanEval для проверки навыков программирования.

Ключевые возможности

  • Поддержка широкого спектра моделей HuggingFace Transformers, включая CausalLM, Seq2SeqLM, Llama и ChatGLM.
  • Интеграция с академическими бенчмарками MMLU, BBH, DROP и HumanEval для комплексной оценки.
  • Наличие публичного лидерборда (leaderboard) для отслеживания результатов и сравнения с другими моделями.
  • Включает дополнительные модули для оценки безопасности (Red-Eval) и письменных навыков (IMPACT).
  • Простота использования: код разработан для удобного и быстрого запуска тестирования на нескольких моделях.

👤 Кому подойдёт: исследователи, разработчики LLM, специалисты по машинному обучению

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.