EleutherAI/lm-evaluation-harness

A framework for few-shot evaluation of language models.

Инструменты⭐ 14 040Pythonпоследний релиз: v0.4.13
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

lm-evaluation-harness — это фреймворк для стандартизированной оценки языковых моделей (LLM) на множестве академических бенчмарков.

Зачем нужен

Инструмент позволяет объективно измерить качество работы моделей, поддерживая few-shot обучение и воспроизводимые тесты. Он полезен для сравнения различных архитектур, проверки эффективности адаптеров (например, LoRA) и обеспечения совместимости результатов с открытыми рейтингами, такими как Hugging Face Open LLM Leaderboard.

Что можно реализовать

  • Сравнение производительности локальных моделей (через transformers или vLLM) с коммерческими API (OpenAI, Anthropic).
  • Оценка качества дообученных моделей с использованием адаптеров PEFT (например, LoRA) на стандартных наборах данных.
  • Участие в рейтингах типа Open LLM Leaderboard с использованием официальных задач и метрик.
  • Создание пользовательских задач оценки с помощью YAML-конфигураций и шаблонов Jinja2.
  • Тестирование мультимодальных моделей (текст+изображение) через прототипные задачи, такие как mmmu.

Ключевые возможности

  • Поддержка более 60 академических бенчмарков и сотен подзадач.
  • Гибкая интеграция бэкендов: HuggingFace transformers, vLLM, SGLang, а также коммерческие API.
  • Конфигурационное управление через YAML и CLI с подкомандами (run, ls, validate).
  • Поддержка продвинутых функций: CoT reasoning traces, steering HF-моделей и асинхронные запросы к API.
  • Использование в качестве бэкенда для Hugging Face Open LLM Leaderboard.

👤 Кому подойдёт: ML-инженеры, AI-исследователи, разработчики LLM-приложений, оценивающие качество моделей.

Релизы

v0.4.13minor
🕐 20 дн назад · релиз на GitHub ↗

Исправлены утечка данных в few-shot, ошибки фильтрации и расчёта ошибок; добавлены бэкенды ONNX и 8 новых бенчмарков.

  • Fixed: Устранена утечка документов в few-shot промпты и ошибка в MultiChoiceRegexFilter, искажавшая результаты.
  • Fixed: Исправлен расчёт стандартной ошибки для групп с неравными размерами и нормализация ответов в minerva_math.
  • Added: Добавлены новые бэкенды onnxruntime и onnxruntime-genai, а также поддержка Megatron-LM v0.18.
  • Added: Включены 8 новых наборов задач: LongProc, Uncheatable Eval, TyDiQA, LegalBench, IndicParam, GreekMMLU, Physics GRE, Putnam Axiom.
v0.4.12majorbreaking
🕐 4 мес назад · релиз на GitHub ↗

Релиз v0.4.12: новые бэкенды (TensorRT-LLM, Megatron, Gaudi, LiteLLM), рефакторинг TaskManager, новые бенчмарки и критические фиксы.

  • Added: Добавлены новые бэкенды: TensorRT-LLM, Megatron-LM, Intel Gaudi и LiteLLM, а также нативная тензорная параллельность для HF.
  • Breaking: Важные изменения: vLLM требует версии >=0.18, SteeredHF переименован в SteeredModel, ограничена поддержка thinking-режима.
  • Added: Появились новые бенчмарки: InfiniteBench, CRUXEval, Toksuite, NEREL-bench (русский) и JFinQA.
  • Fixed: Исправлены критические ошибки в MMLU-Pro, GPQA, RACE, BigBench и других задачах, а также проблемы с токенизацией и шаблонами.