Проблема: «Слепые зоны» в обучении с подкреплением
Мультимодальные большие языковые модели (MLLMs) часто страдают от галлюцинаций, особенно при использовании обучения с подкреплением (RL). Авторы статьи arXiv:2609.28570 выявили две критические проблемы в цепочке коррекции от награды к обновлению параметров:
- На уровне развертки (rollout): Сложные запросы с высокой семантической энтропией часто приводят к группам образцов, где все ответы неверны. Это обнуляет групповое преимущество (group-relative advantage) именно там, где риск галлюцинации максимален.
- На уровне оптимизации: Токены, которые модель считает правильными, но которые ошибочны, становятся «невидимыми» для градиентов. Норма градиента ожидаемого балла исчезает по мере сужения распределения, поэтому самые уверенные ошибки получают weakest updates (наименее сильные обновления).
Решение: DEEPO (Dual-Entropy Enhanced Policy Optimization)
Предложенный метод DEEPO сочетает два этапа для устранения этих проблем:
- Регуляризация дисперсии сигнала: Использование экспертных префиксов, вызванных семантической энтропией, для инъекции заземленных продолжений в запросы с высокой неопределенностью. Это восстанавливает дисперсию преимущества.
- Предобусловливание градиентов: Применение Renyi preconditioning, aware of sign advantage, для противодействия насыщению на уровне логитов. Это позволяет коррекции достигать уверенных ошибок в операционном режиме уверенности.
Результаты и метрики
Метод DEEPO демонстрирует статистически значимые улучшения по сравнению с базовым алгоритмом GRPO. Особенно заметен прирост на сложной задаче VideoMMMU, требующей долгосрочного контекста.
| Метрика / Задача | Результат DEEPO | Примечание |
|---|---|---|
| VideoMMMU | +4.0% | 95% CI [1.1, 6.9], статистически значимо |
| Другие задачи | Аддитивное улучшение | Совместное действие обеих ветвей метода |
| Галлюцинации | Снижены | При сохранении общей точности |
| Стабильность обучения | Сохранена | Критично для RL-фазы |
Значение для индустрии
DEEPO предлагает не просто эмпирическое улучшение, а глубокое понимание того, как градиенты и энтропия взаимодействуют в MLLMs. Метод позволяет моделям быть более «заземленными» в сложных сценариях, не жертвуя общей производительностью. Это важный шаг к созданию надежных мультимодальных ассистентов, способных работать с видео и сложными текстовыми контекстами без выдумывания фактов.
Источник: arXiv cs.AI ↗
