Инструменты1 июля 2026 г., 01:19 МСК🤖 Auto

Hugging Face объединила EEE и Community Evals: единый стандарт для 229k оценок

Hugging Face интегрировала проект EvalEval Coalition (EEE) с собственной системой Community Evals, создав единую экосистему для верификации и кросс-ссылания результатов тестирования LLM.

Баннер новости 2640

Проблема фрагментации данных

Ранее результаты бенчмарков AI-моделей были разрознены: они публиковались в статьях, логах harness и на разных лидербордах, часто с расхождениями. Например, модель LLaMA 65B демонстрировала результаты от 48.8 до 63.7 на MMLU в зависимости от методики. Чтобы решить эту проблему, Hugging Face объединила два инициативы, запущенные в феврале 2026 года: Community Evals (децентрализованные оценки на Hub) и Every Eval Ever (EEE) (стандартизированный JSON-формат метаданных от EvalEval Coalition).

Масштаб инициативы и метрики

Единое хранилище EEE уже аккумулирует огромные массивы данных, что делает невозможным их игнорирование. По состоянию на момент публикации, база данных включает:

  • ~229 000 результатов оценок;
  • 22 000+ различных моделей;
  • 2 200 бенчмарков;
  • Данные из 31 различных форматов отчетности.

Повторный запуск этих тестов с нуля потребовал бы затрат в сотни тысяч долларов, что подчеркивает ценность сохранения исторических данных в структурированном виде.

Техническая интеграция: как это работает

Ключевое нововведение — автоматический конвертер, который преобразует записи EEE в формат YAML, требуемый Hugging Face для файлов .eval_results/*.yaml. Это позволяет авторам моделей и третьим лицам отправлять данные в оба хранилища одновременно. Результат появляется на странице модели с бейджем, ссылающимся на полный JSON-рекорд EEE (с настройками генерации, версией harness и т.д.).

Конвертер обрабатывает конфликты и проверяет существование репозиториев. Ниже приведена структура данных, которую формирует система для ключевых бенчмарков:

Параметр Описание / Пример значения Источник в EEE
dataset.id Идентификатор датасета (напр., openai/gsm8k) evaluation_name
task_id Идентификатор задачи (напр., gsm8k) evaluation_name
value Числовой результат (напр., 96.8) score_details.score
date Дата проведения теста (напр., 2024-07-16) evaluation_timestamp
source.url Ссылка на JSON-файл в EEE Datastore datastore object URL

Статусы верификации и безопасность

Система вводит четкие метки доверия. Результаты, поданные через официальный аккаунт организации, получают значок verified (подтверждено). Пользователи могут видеть, кто отправил оценку: автор модели, сообщество или независимый верификатор. Конвертер автоматически выявляет три типа статусов перед отправкой Pull Request:

  • ready: данные готовы к публикации;
  • score_conflict: обнаружено расхождение с уже существующей оценкой;
  • missing_hf_model: репозиторий модели не найден на Hub.

Инструмент требует явного подтверждения пользователя (ввод команды OPEN PRS) перед публикацией, что исключает случайные изменения. Поддерживаются четыре основных бенчмарка: MMLU-Pro, GPQA, HLE и GSM8K.

Источник: Hugging Face blog ↗