AIKraft/Skills/grpo-rlvr-training

grpo-rlvr-training

Обучайте модели рассуждению и выполнению верифицируемых задач с помощью GRPO и обучения с подкреплением на основе верифицируемых вознаграждений (RLVR). Используйте, когда успех задачи можно алгоритмически проверить (математика, код, вызовы инструментов, структурированный вывод), при разработке функций вознаграждения GRPO или если запуск GRPO расходится или наблюдается «хакинг» вознаграждения.

wshobson official Разработка

Что делает навык

Обучайте модели рассуждению и выполнению верифицируемых задач с помощью GRPO и обучения с подкреплением на основе верифицируемых вознаграждений (RLVR). Используйте, когда успех задачи можно алгоритмически проверить (математика, код, вызовы инструментов, структурированный вывод), при разработке функций вознаграждения GRPO или если запуск GRPO расходится или наблюдается «хакинг» вознаграждения.

Как подключить

1Скачать навык
# возьмите папку навыка «grpo-rlvr-training» из репозитория: # https://github.com/wshobson/agents
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r grpo-rlvr-training/ ~/.claude/skills/grpo-rlvr-training/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.