verl-rl-training
Предоставляет рекомендации по обучению больших языковых моделей (LLM) с использованием обучения с подкреплением (RL) через verl (Volcano Engine RL). Применяется при реализации RLHF, GRPO, PPO или других алгоритмов RL для постобучения LLM в масштабе с использованием гибких бэкендов инфраструктуры.
Что делает навык
Предоставляет рекомендации по обучению больших языковых моделей (LLM) с использованием обучения с подкреплением (RL) через verl (Volcano Engine RL). Применяется при реализации RLHF, GRPO, PPO или других алгоритмов RL для постобучения LLM в масштабе с использованием гибких бэкендов инфраструктуры.
Как подключить
SKILL.md к навыкам ассистентаНавык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.