Исследования31 июля 2026 г., 07:16 МСК🤖 Auto

RL против SFT: почему модели с подкреплением лучше решают математику

Исследование из arXiv выявило, что обучение с подкреплением (RL) создает более структурированные внутренние представления для математических задач, чем supervised fine-tuning (SFT).

Баннер новости 4779

Механика превосходства RL

Новое исследование, представленное на Second Workshop on XAI4Science (AAAI 2026), вскрывает механистические причины, по которым Large Reasoning Models (LRM), обученные с помощью reinforcement learning (RL), превосходят модели, прошедшие только supervised fine-tuning (SFT). Авторы — Антьябха Рахман, Акшай Гуругубелли и коллеги — использовали линейные зонды (linear probes) на скрытых состояниях слоев, чтобы оценить качество репрезентаций.

Ключевой вывод: RL-модели демонстрируют более высокую точность в предсказании правильности ответа, что указывает на то, что их внутренние представления являются более линейно разделимыми и структурированными. Это означает, что модель «понимает» логику решения на более глубоком уровне, а не просто запоминает паттерны.

Иерархия слоев: RL против равномерного распределения

Анализ методом абляции (mean ablation studies) показал фундаментальное различие в архитектуре обработки информации. В то время как SFT-модели распределяют важность слоев равномерно, RL-модели формируют иерархическую структуру, где глубинные слои становятся progressively more critical (прогрессивно более важными) для решения задачи.

Характеристика RL Fine-Tuned SFT Fine-Tuned
Качество репрезентаций Высокая линейная разделимость Более размытые представления
Архитектура обработки Иерархическая (глубокие слои критичны) Равномерное распределение важности
Адаптивное выделение токенов Высокая вариативность (в некоторых моделях) Более стабильное распределение

Адаптивное распределение вычислений

Авторы также проанализировали вариативность количества токенов при повторной выборке. Наблюдается высокая вариативность в некоторых RL-моделях, что интерпретируется как «разброс правдоподобных рассуждений в политике» (spread of plausible on-policy reasoning). Это позволяет отличать модели со стабильной политикой от тех, чье поведение решений является неопределенным или неидентифицируемым.

Значение для индустрии

Результаты подтверждают, что RL-обучение не просто оптимизирует метрики, а фундаментально перестраивает способ, которым нейросети представляют и обрабатывают сложные логические задачи. Это важно для разработчиков, выбирающих между SFT и RL для создания специализированных математических или логических агентов.

Источник: arXiv cs.AI ↗