Проблема фрагментации данных
Ранее результаты бенчмарков AI-моделей были разрознены: они публиковались в статьях, логах harness и на разных лидербордах, часто с расхождениями. Например, модель LLaMA 65B демонстрировала результаты от 48.8 до 63.7 на MMLU в зависимости от методики. Чтобы решить эту проблему, Hugging Face объединила два инициативы, запущенные в феврале 2026 года: Community Evals (децентрализованные оценки на Hub) и Every Eval Ever (EEE) (стандартизированный JSON-формат метаданных от EvalEval Coalition).
Масштаб инициативы и метрики
Единое хранилище EEE уже аккумулирует огромные массивы данных, что делает невозможным их игнорирование. По состоянию на момент публикации, база данных включает:
- ~229 000 результатов оценок;
- 22 000+ различных моделей;
- 2 200 бенчмарков;
- Данные из 31 различных форматов отчетности.
Повторный запуск этих тестов с нуля потребовал бы затрат в сотни тысяч долларов, что подчеркивает ценность сохранения исторических данных в структурированном виде.
Техническая интеграция: как это работает
Ключевое нововведение — автоматический конвертер, который преобразует записи EEE в формат YAML, требуемый Hugging Face для файлов .eval_results/*.yaml. Это позволяет авторам моделей и третьим лицам отправлять данные в оба хранилища одновременно. Результат появляется на странице модели с бейджем, ссылающимся на полный JSON-рекорд EEE (с настройками генерации, версией harness и т.д.).
Конвертер обрабатывает конфликты и проверяет существование репозиториев. Ниже приведена структура данных, которую формирует система для ключевых бенчмарков:
| Параметр | Описание / Пример значения | Источник в EEE |
|---|---|---|
| dataset.id | Идентификатор датасета (напр., openai/gsm8k) | evaluation_name |
| task_id | Идентификатор задачи (напр., gsm8k) | evaluation_name |
| value | Числовой результат (напр., 96.8) | score_details.score |
| date | Дата проведения теста (напр., 2024-07-16) | evaluation_timestamp |
| source.url | Ссылка на JSON-файл в EEE Datastore | datastore object URL |
Статусы верификации и безопасность
Система вводит четкие метки доверия. Результаты, поданные через официальный аккаунт организации, получают значок verified (подтверждено). Пользователи могут видеть, кто отправил оценку: автор модели, сообщество или независимый верификатор. Конвертер автоматически выявляет три типа статусов перед отправкой Pull Request:
- ready: данные готовы к публикации;
- score_conflict: обнаружено расхождение с уже существующей оценкой;
- missing_hf_model: репозиторий модели не найден на Hub.
Инструмент требует явного подтверждения пользователя (ввод команды OPEN PRS) перед публикацией, что исключает случайные изменения. Поддерживаются четыре основных бенчмарка: MMLU-Pro, GPQA, HLE и GSM8K.
Источник: Hugging Face blog ↗
