Релиз модели21 июля 2026 г., 10:16 МСК🤖 Auto

PPO-HSC: Как RLVR спасает LLM от «невидимых оков» коллапса режимов

Исследователи представили PPO-HSC — фреймворк для тонкой настройки LLM, который через поощрение семантической новизны решает проблему коллапса режимов, типичную для стандартного RLVR.

Баннер новости 4018

Проблема: «Невидимые оковы» RLVR

Стандартные методы обучения с подкреплением на основе верифицируемых вознаграждений (RLVR) эффективны, но имеют критический недостаток. Они заставляют модель чрезмерно оптимизировать уже известные решения, что приводит к коллапсу режимов (mode collapse). Явление, авторы называют «невидимыми оковами»: модель теряет способность к исследованию (exploration) и теряет доступ к более широкому пространству решений, жертвуя разнообразием ради локального максимума.

Решение: PPO-HSC и High-order Sampling Coverage

Новый фреймворк PPO-HSC (Proximal Policy Optimization with High-order Sampling Coverage) вводит механизм High-order Sampling Coverage (HSC). Его цель — поощрять обнаружение паттернов рассуждений, которые являются одновременно низкосимиллярными (семантически новыми) и высоковалидными (правильными).

Механизм работает через:

  • Динамическую библиотеку траекторий: система хранит проверенные уникальные решения.
  • Дифференцируемый сигнал: награда начисляется за семантическую новизну.
  • Ограничение правдоподобия: структурная рациональность решений сохраняется через специальные constraints, чтобы новизна не превращалась в бред.

Результаты: Точность против Разнообразия

Эмпирические тесты проводились на задачах математического рассуждения (GSM8K, SVAMP) и генерации кода. PPO-HSC демонстрирует значительное улучшение покрытия пространства состояний (state-space coverage) и разнообразия решений, не жертвуя при этом точностью по сравнению с SOTA-базовыми моделями RL.

Метрика / Задача Стандартный RLVR PPO-HSC Значение
Разнообразие решений Низкое (коллапс режимов) Высокое Модель находит нестандартные пути решения
Покрытие пространства состояний Ограниченное Значительно расширенное Лучшая способность к обобщению
Точность (Accuracy) Высокая Высокая / Превосходящая Новизна не снижает качество ответа
Задачи GSM8K, SVAMP, Code Gen GSM8K, SVAMP, Code Gen Проверено на сложных логических задачах

Почему это важно

Работа авторов Юцзе Шэня (Yujie Shen) и Хаовэня Чэня (Haowen Chen), опубликованная 8 мая 2026 года, предлагает путь к созданию более «любопытных» и адаптивных моделей. В условиях, когда стандартное RLVR приводит к гомогенизации ответов LLM, PPO-HSC позволяет сохранять структурную целостность, одновременно расширяя когнитивный диапазон модели. Это критически важно для задач, требующих креативного программирования и сложных математических выводов, где единственно верный путь — не всегда лучший.

Источник: arXiv cs.AI ↗