grpo-rlvr-training
Обучайте модели рассуждению и выполнению верифицируемых задач с помощью GRPO и обучения с подкреплением на основе верифицируемых вознаграждений (RLVR). Используйте, когда успех задачи можно алгоритмически проверить (математика, код, вызовы инструментов, структурированный вывод), при разработке функций вознаграждения GRPO или если запуск GRPO расходится или наблюдается «хакинг» вознаграждения.
Что делает навык
Обучайте модели рассуждению и выполнению верифицируемых задач с помощью GRPO и обучения с подкреплением на основе верифицируемых вознаграждений (RLVR). Используйте, когда успех задачи можно алгоритмически проверить (математика, код, вызовы инструментов, структурированный вывод), при разработке функций вознаграждения GRPO или если запуск GRPO расходится или наблюдается «хакинг» вознаграждения.
Как подключить
SKILL.md к навыкам ассистентаНавык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.