Исследования22 сентября 2026 г., 10:18 МСК🤖 Auto

GVPO++: Прорыв в пост-обучении LLM без importance sampling

Исследователи представили GVPO++ — метод пост-обучения LLM, устраняющий нестабильность GRPO за счет отказа от importance sampling и гарантирующий единственное оптимальное решение.

Баннер новости 8022

Проблема нестабильности в современных методах

Пост-обучение (post-training) критически важно для улучшения рассуждений и специализации больших языковых моделей (LLM). Однако такие популярные методы, как Group Relative Policy Optimization (GRPO), сталкиваются с серьезной проблемой: нестабильностью обучения. Эта нестабильность возникает из-за зависимости от importance sampling (выборки важности), что затрудняет их практическое развертывание в промышленных условиях.

Суть метода GVPO++

Команда исследователей во главе с Каичэнем Чжаном (Kaichen Zhang) представила GVPO++ (Group Variance Policy Optimization). В основе метода лежит аналитическое решение задачи максимизации награды с ограничением KL-дивергенции. Ключевая инновация заключается в том, что градиент GVPO интерпретируется как среднеквадратичная ошибка между центральной дистанцией неявных наград и фактических наград.

Ключевые преимущества

GVPO++ предлагает два фундаментальных преимущества перед существующими аналогами:

  • Гарантия единственного решения: Метод гарантирует нахождение единственного оптимального решения, точно соответствующего цели максимизации награды с ограничением KL.
  • Отказ от importance sampling: GVPO позволяет использовать гибкие распределения выборки без необходимости применения importance sampling, что радикально повышает стабильность процесса.

Расширение на On-Policy Distillation (OPD)

Метод не ограничивается только пост-обучением. GVPO++ естественно расширяется на on-policy distillation (OPD). Это позволяет оптимизировать широкий семейство расширенных целей OPD, предоставляя теоретически обоснованную базу для проектирования разнообразных задач обучения. Таким образом, GVPO++ устанавливает новую парадигму надежного и универсального пост-обучения LLM.

Характеристика GRPO (стандарт) GVPO++ (новое)
Метод выборки Importance Sampling Гибкие распределения (без IS)
Стабильность обучения Низкая (риск расхождения) Высокая (аналитическое решение)
Оптимальность Локальные экстремумы Гарантированное единственное решение
Применение Пост-обучение Пост-обучение + On-Policy Distillation

Работа является расширенной версией статьи, представленной на NeurIPS 2025, и опубликована в arXiv 18 сентября 2026 года.

Источник: arXiv cs.AI ↗