Проблема «слепых» ветвлений
В reinforcement learning с верифицируемыми наградами (RLVR) деревья поиска позволяют оценивать ценность каждого шага. Однако каждое ветвление (fork) увеличивает стоимость вычислений. Если разветвить цепочку там, где результат уже предопределен, «сibling»-ветки будут слишком похожи, и сигнал для обучения будет нулевым. Традиционные методы используют фиксированные длины, середины или энтропию токенов, что часто приводит к неэффективным вложениям ресурсов.
Решение: разветвлять там, где модель «сомневается»
Авторы (Bin Lei, Yu Li и др.) предлагают Belief-Shift Branching. Идея проста: анализируйте «веру» (belief) модели в правильность ответа на границах шагов. Ветвление происходит в точке, где последовательные убеждения расходятся сильнее всего. Это позволяет находить «поворотные точки» кривой ценности без дополнительного обучения модели.
Три уровня доступа к внутренностям модели
Метод реализован в трех вариантах, не требующих step-level supervision:
- Black-box probe: работа с моделью как с «черным ящиком».
- Logit-lens: анализ профиля глубины логитов.
- Learned activation: направление активации, обученное офлайн (используется только для валидации перед RL).
Эффективность и стоимость
Ключевое преимущество — экономия. Стоимость сигнала для размещения ветвей составляет всего ~1% от вычислений на математику и <5% на код. При этом в валидации против кривых Монте-Карло метод занял первое место во всех 8 панелях (модель × бенчмарк), опередив энтропию и LLM-judge.
Результаты RLVR: прорыв на OLMo-3-7B
В реальных тестах reinforcement learning на трех семействах моделей метод Belief-Shift Branching показал доминирующие результаты:
| Бенчмарк | Модель | Прирост (Delta) | Примечание |
|---|---|---|---|
| AIME 2026 | OLMo-3-7B | +2.9 | Лучший результат среди математических агрегатов |
| LiveCodeBench-medium | OLMo-3-7B | +6.5 | Полное доминирование в колонках кода |
| Math Aggregate | OLMo-3-7B | +2.6 | Общий прирост по математике |
Работа демонстрирует, что точечное управление структурой дерева поиска через анализ внутренних состояний модели может значительно ускорить и улучшить качество обучения без увеличения бюджета инференса.
Источник: arXiv cs.AI ↗
