stanford-crfm/helm

Holistic Evaluation of Language Models (HELM) is an open source Python framework created by the Center for Research on Foundation Models (CRFM) at Stanford for holistic, reproducible and transparent evaluation of foundation models, including large language models (LLMs) and multimodal models.

Инструменты⭐ 2 916Pythonпоследний релиз: v0.5.16
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

HELM — это фреймворк от Стэнфорда для комплексной, воспроизводимой и прозрачной оценки больших языковых моделей (LLM) и мультимодальных моделей.

Зачем нужен

Инструмент решает задачу объективного сравнения моделей по широкому спектру метрик, выходящих за рамки простой точности, включая эффективность, предвзятость и токсичность. Он полезен для исследователей и разработчиков, которым нужно стандартизированное сравнение моделей от разных провайдеров (OpenAI, Anthropic, Google) в едином формате.

Что можно реализовать

  • Проведение комплексного бенчмаркинга LLM на известных датасетах (MMLU-Pro, GPQA, IFEval) с использованием единого интерфейса.
  • Сравнение моделей от разных провайдеров по метрикам безопасности, предвзятости и эффективности, а не только по качеству ответов.
  • Воспроизведение результатов научных статей и лидербордов, опубликованных командой CRFM.
  • Визуальный анализ отдельных промптов и ответов через встроенный веб-интерфейс для отладки и аудита моделей.

Ключевые возможности

  • Единый интерфейс для доступа к моделям от различных провайдеров (OpenAI, Anthropic, Google Gemini).
  • Встроенные веб-интерфейсы для инспекции результатов (Web UI) и публичные лидерборды (Capabilities, Safety, VHELM).
  • Поддержка стандартизированных датасетов и бенчмарков, включая мультимодальные (VHELM, HEIM) и специализированные (MedHELM, Audio).
  • Воспроизводимость результатов: возможность запустить те же тесты, что использовались в научных публикациях.

👤 Кому подойдёт: исследователи, ML-инженеры, специалисты по безопасности AI, разработчики, оценивающие LLM и мультимодальные модели

Релизы

v0.5.16minorbreaking
🕐 4 мес назад · релиз на GitHub ↗

Устаревание модели meta/llama-3.1-405b-instruct-turbo и добавление двух новых сценариев для арабского языка.

  • Deprecated: Модель meta/llama-3.1-405b-instruct-turbo признана устаревшей и исключена из аннотаторов.
  • Breaking: Модель больше не используется в качестве судьи в Omni-MATH, WildBench, HarmBench, XSTest и сценариях Anthropic Red Team.
  • Added: Добавлены новые сценарии для арабского языка: юридический и генерация контента.
  • Fixed: Исправлено некорректное парсинг пути к файлу как JSON в AutobencherSafetyScenario.
  • Added: Миграция интеграции Unitxt на использование нового API.