AIKraft/Skills/Hugging Face Тренер моделей

Hugging Face Тренер моделей

This skill should be used when users want to train or fine-tune language models using TRL (Transformer Reinforcement Learning) on Hugging Face Jobs infrastructure. Covers SFT, DPO, GRPO and reward modeling training methods, plus GGUF conversion for local deployment. Includes guidance on the TRL Jobs package, UV scripts with PEP 723 format, dataset preparation and validation, hardware selection, co

HFHugging Face official Данные

Что делает навык

Навык позволяет обучать и дообучать языковые модели с использованием библиотеки TRL на управляемой инфраструктуре Hugging Face Jobs без необходимости локальной настройки GPU. Он поддерживает методы SFT, DPO, GRPO и обучение моделей вознаграждения, а также конвертацию моделей в формат GGUF для локального развертывания.

Когда применять

  • Обучение модели методом SFT (Supervised Fine-Tuning) для настройки инструкций.
  • Выравнивание модели с использованием предпочтений через метод DPO (Direct Preference Optimization).
  • Онлайн-обучение с подкреплением с помощью GRPO (Group Relative Policy Optimization).
  • Подготовка и валидация датасетов для обучения на инфраструктуре Hugging Face.
  • Конвертация обученной модели в формат GGUF для локального развёртывания.

Как работает

  1. Использовать пакет TRL Jobs и UV-скрипты в формате PEP 723 для настройки окружения.
  2. Подготовить и валидировать датасеты для обучения.
  3. Выбрать подходящее оборудование на инфраструктуре Hugging Face Jobs.
  4. Запустить процесс обучения (SFT, DPO, GRPO или Reward Modeling) на облачных GPU.
  5. Автоматически сохранить результаты обучения в Hugging Face Hub.
  6. При необходимости конвертировать модель в формат GGUF.

Примеры запросов агенту

Обучи модель методом DPO на предпочтениях с помощью TRL на Hugging Face Jobs.
Настрой инструкционное обучение модели через SFT, используя UV-скрипты PEP 723.
Конвертируй обученную модель в формат GGUF для локального развёртывания.

Что понадобится

  • Доступ к инфраструктуре Hugging Face Jobs
  • Библиотека TRL (Transformer Reinforcement Learning)
  • Установка UV для управления скриптами PEP 723

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «hugging-face-model-trainer» из репозитория: # https://github.com/huggingface/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r hugging-face-model-trainer/ ~/.claude/skills/hugging-face-model-trainer/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.