eval-model
Оценивает точность текстовых моделей MAX по стандартным бенчмаркам (GSM8K, MMLU, HellaSwag и др.). Используйте для сравнения с модельными картами, проверки ответов новой модели MAX или запуска повторяемых оценок через MAX OpenAI-compatible endpoint.
AImodular
official
Разработка
★ 200
Что делает навык
Оценивает точность текстовых моделей MAX по стандартным бенчмаркам (GSM8K, MMLU, HellaSwag и др.). Используйте для сравнения с модельными картами, проверки ответов новой модели MAX или запуска повторяемых оценок через MAX OpenAI-compatible endpoint.
Как подключить
1Скачать навык
# возьмите папку навыка «eval-model» из репозитория:
# https://github.com/modular/skills
2Положить папку с
SKILL.md к навыкам ассистента# положите папку навыка туда, где ассистент ищет skills:
cp -r eval-model/ ~/.claude/skills/eval-model/
Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.