Проблема: Знание против Универсальности
Создание специализированных ролевых моделей (Role-playing models) традиционно сталкивается с дилеммой. Чтобы модель вела себя аутентично, ей необходимо внедрить глубокие доменные знания. Однако, как показывают исследования, эффективное внедрение такой специализированной информации часто приводит к катастрофическому забыванию (catastrophic forgetting) базовых агентских способностей модели. KuaiRP Series предлагает решение этой проблемы через многоэтапный конвейер обучения.
Архитектура обучения: 3 ключевых этапа
Авторы разработали конвейер, состоящий из трех критически важных стадий, направленных на упрощение промпт-инжиниринга, стабилизацию качества и сохранение эффективности:
- Этап 1: SFT (Supervised Fine-Tuning) с фильтрацией. Используется стандартизированный шаблон персонажа. Данные для обучения генерируются на основе симуляции поведения пользователей и обратной фильтрации профилей, что повышает релевантность ответов.
- Этап 2: RL (Reinforcement Learning) с правилом. Вводится композитная функция вознаграждения на основе правил. Это позволяет устранить типичные деградации качества, такие как «раздувание» длины ответа (length expansion) и зацикливание (repetitive generation).
- Этап 3: Самодистилляция (OPD + CDD). Для восстановления общих способностей применяется новая парадигма Two-stage On-Policy Distillation (OPD) с Cumulative-Divergence Decay (CDD). Здесь доменно-адаптированная модель выступает учителем, а исходная базовая модель — учеником, что позволяет балансировать между глубоким знанием домена и сохранением универсальности.
Результаты и метрики
Эксперименты показали, что модели серии KuaiRP не только сопоставимы с текущими проприетарными лидерами рынка по степени достоверности отыгрыша роли (fidelity) в целевых доменах, но и успешно восстанавливают общие агентские способности. При этом сохраняется крайне низкая стоимость развертывания благодаря малому размеру параметров.
| Характеристика | Описание решения в KuaiRP |
|---|---|
| Основная проблема | Катастрофическое забывание общих навыков при обучении роли |
| Метод восстановления | Two-stage On-Policy Distillation (OPD) с Cumulative-Divergence Decay (CDD) |
| Борьба с артефактами | Правило-базированная функция вознаграждения в RL (против длины и повторов) |
| Ключевые преимущества | Упрощение промптов, стабильность, низкая стоимость деплоя |
Почему это важно
Технический отчет открывает путь к созданию коммерчески viable ролевых ИИ-ассистентов, которые не «тупеют» после узкой специализации. Использование самодистилляции позволяет избежать необходимости переобучения огромных базовых моделей с нуля, снижая вычислительные затраты и делая технологию доступнее для внедрения в нишевые приложения.
Источник: arXiv cs.AI ↗
