Релиз модели12 сентября 2026 г., 13:17 МСК🤖 Auto

KuaiRP: Как обучить ролевую модель без потери общих навыков

Исследователи представили технический отчет о серии моделей KuaiRP, решивших главную проблему ролевого ИИ: катастрофическое забывание общих способностей при глубокой адаптации под конкретный домен.

Баннер новости 7350

Проблема: Знание против Универсальности

Создание специализированных ролевых моделей (Role-playing models) традиционно сталкивается с дилеммой. Чтобы модель вела себя аутентично, ей необходимо внедрить глубокие доменные знания. Однако, как показывают исследования, эффективное внедрение такой специализированной информации часто приводит к катастрофическому забыванию (catastrophic forgetting) базовых агентских способностей модели. KuaiRP Series предлагает решение этой проблемы через многоэтапный конвейер обучения.

Архитектура обучения: 3 ключевых этапа

Авторы разработали конвейер, состоящий из трех критически важных стадий, направленных на упрощение промпт-инжиниринга, стабилизацию качества и сохранение эффективности:

  • Этап 1: SFT (Supervised Fine-Tuning) с фильтрацией. Используется стандартизированный шаблон персонажа. Данные для обучения генерируются на основе симуляции поведения пользователей и обратной фильтрации профилей, что повышает релевантность ответов.
  • Этап 2: RL (Reinforcement Learning) с правилом. Вводится композитная функция вознаграждения на основе правил. Это позволяет устранить типичные деградации качества, такие как «раздувание» длины ответа (length expansion) и зацикливание (repetitive generation).
  • Этап 3: Самодистилляция (OPD + CDD). Для восстановления общих способностей применяется новая парадигма Two-stage On-Policy Distillation (OPD) с Cumulative-Divergence Decay (CDD). Здесь доменно-адаптированная модель выступает учителем, а исходная базовая модель — учеником, что позволяет балансировать между глубоким знанием домена и сохранением универсальности.

Результаты и метрики

Эксперименты показали, что модели серии KuaiRP не только сопоставимы с текущими проприетарными лидерами рынка по степени достоверности отыгрыша роли (fidelity) в целевых доменах, но и успешно восстанавливают общие агентские способности. При этом сохраняется крайне низкая стоимость развертывания благодаря малому размеру параметров.

Характеристика Описание решения в KuaiRP
Основная проблема Катастрофическое забывание общих навыков при обучении роли
Метод восстановления Two-stage On-Policy Distillation (OPD) с Cumulative-Divergence Decay (CDD)
Борьба с артефактами Правило-базированная функция вознаграждения в RL (против длины и повторов)
Ключевые преимущества Упрощение промптов, стабильность, низкая стоимость деплоя

Почему это важно

Технический отчет открывает путь к созданию коммерчески viable ролевых ИИ-ассистентов, которые не «тупеют» после узкой специализации. Использование самодистилляции позволяет избежать необходимости переобучения огромных базовых моделей с нуля, снижая вычислительные затраты и делая технологию доступнее для внедрения в нишевые приложения.

Источник: arXiv cs.AI ↗