Исследования12 сентября 2026 г., 12:16 МСК🤖 Auto

Belief-Shift Branching: как ИИ сам находит точки роста для RL

Исследователи представили метод Belief-Shift Branching, который размещает ветвления в дереве поиска RLVR там, где модель меняет уверенность. Это дало прирост до +6.5 баллов на LiveCodeBench.

Баннер новости 7347

Проблема «слепых» ветвлений

В reinforcement learning с верифицируемыми наградами (RLVR) деревья поиска позволяют оценивать ценность каждого шага. Однако каждое ветвление (fork) увеличивает стоимость вычислений. Если разветвить цепочку там, где результат уже предопределен, «сibling»-ветки будут слишком похожи, и сигнал для обучения будет нулевым. Традиционные методы используют фиксированные длины, середины или энтропию токенов, что часто приводит к неэффективным вложениям ресурсов.

Решение: разветвлять там, где модель «сомневается»

Авторы (Bin Lei, Yu Li и др.) предлагают Belief-Shift Branching. Идея проста: анализируйте «веру» (belief) модели в правильность ответа на границах шагов. Ветвление происходит в точке, где последовательные убеждения расходятся сильнее всего. Это позволяет находить «поворотные точки» кривой ценности без дополнительного обучения модели.

Три уровня доступа к внутренностям модели

Метод реализован в трех вариантах, не требующих step-level supervision:

  • Black-box probe: работа с моделью как с «черным ящиком».
  • Logit-lens: анализ профиля глубины логитов.
  • Learned activation: направление активации, обученное офлайн (используется только для валидации перед RL).

Эффективность и стоимость

Ключевое преимущество — экономия. Стоимость сигнала для размещения ветвей составляет всего ~1% от вычислений на математику и <5% на код. При этом в валидации против кривых Монте-Карло метод занял первое место во всех 8 панелях (модель × бенчмарк), опередив энтропию и LLM-judge.

Результаты RLVR: прорыв на OLMo-3-7B

В реальных тестах reinforcement learning на трех семействах моделей метод Belief-Shift Branching показал доминирующие результаты:

Бенчмарк Модель Прирост (Delta) Примечание
AIME 2026 OLMo-3-7B +2.9 Лучший результат среди математических агрегатов
LiveCodeBench-medium OLMo-3-7B +6.5 Полное доминирование в колонках кода
Math Aggregate OLMo-3-7B +2.6 Общий прирост по математике

Работа демонстрирует, что точечное управление структурой дерева поиска через анализ внутренних состояний модели может значительно ускорить и улучшить качество обучения без увеличения бюджета инференса.

Источник: arXiv cs.AI ↗