Проблема: «Невидимые оковы» RLVR
Стандартные методы обучения с подкреплением на основе верифицируемых вознаграждений (RLVR) эффективны, но имеют критический недостаток. Они заставляют модель чрезмерно оптимизировать уже известные решения, что приводит к коллапсу режимов (mode collapse). Явление, авторы называют «невидимыми оковами»: модель теряет способность к исследованию (exploration) и теряет доступ к более широкому пространству решений, жертвуя разнообразием ради локального максимума.
Решение: PPO-HSC и High-order Sampling Coverage
Новый фреймворк PPO-HSC (Proximal Policy Optimization with High-order Sampling Coverage) вводит механизм High-order Sampling Coverage (HSC). Его цель — поощрять обнаружение паттернов рассуждений, которые являются одновременно низкосимиллярными (семантически новыми) и высоковалидными (правильными).
Механизм работает через:
- Динамическую библиотеку траекторий: система хранит проверенные уникальные решения.
- Дифференцируемый сигнал: награда начисляется за семантическую новизну.
- Ограничение правдоподобия: структурная рациональность решений сохраняется через специальные constraints, чтобы новизна не превращалась в бред.
Результаты: Точность против Разнообразия
Эмпирические тесты проводились на задачах математического рассуждения (GSM8K, SVAMP) и генерации кода. PPO-HSC демонстрирует значительное улучшение покрытия пространства состояний (state-space coverage) и разнообразия решений, не жертвуя при этом точностью по сравнению с SOTA-базовыми моделями RL.
| Метрика / Задача | Стандартный RLVR | PPO-HSC | Значение |
|---|---|---|---|
| Разнообразие решений | Низкое (коллапс режимов) | Высокое | Модель находит нестандартные пути решения |
| Покрытие пространства состояний | Ограниченное | Значительно расширенное | Лучшая способность к обобщению |
| Точность (Accuracy) | Высокая | Высокая / Превосходящая | Новизна не снижает качество ответа |
| Задачи | GSM8K, SVAMP, Code Gen | GSM8K, SVAMP, Code Gen | Проверено на сложных логических задачах |
Почему это важно
Работа авторов Юцзе Шэня (Yujie Shen) и Хаовэня Чэня (Haowen Chen), опубликованная 8 мая 2026 года, предлагает путь к созданию более «любопытных» и адаптивных моделей. В условиях, когда стандартное RLVR приводит к гомогенизации ответов LLM, PPO-HSC позволяет сохранять структурную целостность, одновременно расширяя когнитивный диапазон модели. Это критически важно для задач, требующих креативного программирования и сложных математических выводов, где единственно верный путь — не всегда лучший.
Источник: arXiv cs.AI ↗
