huggingface/lighteval

Lighteval is your all-in-one toolkit for evaluating LLMs across multiple backends

Инструменты⭐ 2 547Pythonпоследний релиз: v0.13.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Lighteval — это универсальный инструмент от Hugging Face для быстрой и гибкой оценки качества больших языковых моделей (LLM).

Зачем нужен

Инструмент позволяет проводить детальное тестирование моделей на более чем 1000 задачах, сохраняя результаты по каждому образцу для глубокого анализа и отладки. Он полезен тем, кто хочет сравнить производительность моделей, проверить их знания или навыки рассуждения, используя различные бэкенды для инференса.

Что можно реализовать

  • Сравнение производительности LLM на стандартных бенчмарках (MMLU, GSM8K, HELM) с использованием разных бэкендов (vLLM, Accelerate, SGLang).
  • Оценка способности моделей следовать инструкциям (IFEval) и работать с длинным контекстом (RULER).
  • Тестирование моделей на мультиязычных данных, включая русский (RUMMLU), китайский (CMMLU) и другие языки.
  • Создание пользовательских задач и метрик для специфических сценариев использования, не входящих в стандартный набор.

Ключевые возможности

  • Поддержка 1000+ задач в областях знаний, математики, кода, чат-моделей и NLU.
  • Гибкость бэкендов: работа с моделями в памяти, через vLLM, SGLang, Hugging Face Inference Endpoints или LiteLLM.
  • Детальная аналитика: сохранение и исследование результатов на уровне отдельных сэмплов для отладки.
  • Возможность создания кастомных задач и метрик под конкретные нужды.
  • Интеграция с Hugging Face Hub для публикации результатов и доступа к Open Benchmark Index.

👤 Кому подойдёт: Исследователи в области NLP, ML-инженеры, разработчики LLM-приложений и специалисты по оценке моделей.

Релизы

v0.13.0majorbreaking
🕐 10 мес назад · релиз на GitHub ↗

В Lighteval v0.13.0 введена новая задача AA Omniscience, устранены баги в метриках и автобатчинге, а также изменена структура конфигураций задач.

  • Breaking: Изменена структура определения задач: теперь одна задача соответствует одному файлу.
  • Added: Добавлена новая задача для оценки AA Omniscience.
  • Added: В реестр добавлен дамп задач для улучшения документации и добавлен стиль бота.
  • Fixed: Исправлена ошибка в аргументах метода MajAtN.compute и некорректная агрегация батчированных метрик.
  • Fixed: Устранена проблема с размером автобатчинга и обновлена конфигурация LiteLLM для провайдера hosted_vllm.