Проблема нестабильности в современных методах
Пост-обучение (post-training) критически важно для улучшения рассуждений и специализации больших языковых моделей (LLM). Однако такие популярные методы, как Group Relative Policy Optimization (GRPO), сталкиваются с серьезной проблемой: нестабильностью обучения. Эта нестабильность возникает из-за зависимости от importance sampling (выборки важности), что затрудняет их практическое развертывание в промышленных условиях.
Суть метода GVPO++
Команда исследователей во главе с Каичэнем Чжаном (Kaichen Zhang) представила GVPO++ (Group Variance Policy Optimization). В основе метода лежит аналитическое решение задачи максимизации награды с ограничением KL-дивергенции. Ключевая инновация заключается в том, что градиент GVPO интерпретируется как среднеквадратичная ошибка между центральной дистанцией неявных наград и фактических наград.
Ключевые преимущества
GVPO++ предлагает два фундаментальных преимущества перед существующими аналогами:
- Гарантия единственного решения: Метод гарантирует нахождение единственного оптимального решения, точно соответствующего цели максимизации награды с ограничением KL.
- Отказ от importance sampling: GVPO позволяет использовать гибкие распределения выборки без необходимости применения importance sampling, что радикально повышает стабильность процесса.
Расширение на On-Policy Distillation (OPD)
Метод не ограничивается только пост-обучением. GVPO++ естественно расширяется на on-policy distillation (OPD). Это позволяет оптимизировать широкий семейство расширенных целей OPD, предоставляя теоретически обоснованную базу для проектирования разнообразных задач обучения. Таким образом, GVPO++ устанавливает новую парадигму надежного и универсального пост-обучения LLM.
| Характеристика | GRPO (стандарт) | GVPO++ (новое) |
|---|---|---|
| Метод выборки | Importance Sampling | Гибкие распределения (без IS) |
| Стабильность обучения | Низкая (риск расхождения) | Высокая (аналитическое решение) |
| Оптимальность | Локальные экстремумы | Гарантированное единственное решение |
| Применение | Пост-обучение | Пост-обучение + On-Policy Distillation |
Работа является расширенной версией статьи, представленной на NeurIPS 2025, и опубликована в arXiv 18 сентября 2026 года.
Источник: arXiv cs.AI ↗
