Механика превосходства RL
Новое исследование, представленное на Second Workshop on XAI4Science (AAAI 2026), вскрывает механистические причины, по которым Large Reasoning Models (LRM), обученные с помощью reinforcement learning (RL), превосходят модели, прошедшие только supervised fine-tuning (SFT). Авторы — Антьябха Рахман, Акшай Гуругубелли и коллеги — использовали линейные зонды (linear probes) на скрытых состояниях слоев, чтобы оценить качество репрезентаций.
Ключевой вывод: RL-модели демонстрируют более высокую точность в предсказании правильности ответа, что указывает на то, что их внутренние представления являются более линейно разделимыми и структурированными. Это означает, что модель «понимает» логику решения на более глубоком уровне, а не просто запоминает паттерны.
Иерархия слоев: RL против равномерного распределения
Анализ методом абляции (mean ablation studies) показал фундаментальное различие в архитектуре обработки информации. В то время как SFT-модели распределяют важность слоев равномерно, RL-модели формируют иерархическую структуру, где глубинные слои становятся progressively more critical (прогрессивно более важными) для решения задачи.
| Характеристика | RL Fine-Tuned | SFT Fine-Tuned |
|---|---|---|
| Качество репрезентаций | Высокая линейная разделимость | Более размытые представления |
| Архитектура обработки | Иерархическая (глубокие слои критичны) | Равномерное распределение важности |
| Адаптивное выделение токенов | Высокая вариативность (в некоторых моделях) | Более стабильное распределение |
Адаптивное распределение вычислений
Авторы также проанализировали вариативность количества токенов при повторной выборке. Наблюдается высокая вариативность в некоторых RL-моделях, что интерпретируется как «разброс правдоподобных рассуждений в политике» (spread of plausible on-policy reasoning). Это позволяет отличать модели со стабильной политикой от тех, чье поведение решений является неопределенным или неидентифицируемым.
Значение для индустрии
Результаты подтверждают, что RL-обучение не просто оптимизирует метрики, а фундаментально перестраивает способ, которым нейросети представляют и обрабатывают сложные логические задачи. Это важно для разработчиков, выбирающих между SFT и RL для создания специализированных математических или логических агентов.
Источник: arXiv cs.AI ↗
