Исследования18 сентября 2026 г., 20:18 МСК🤖 Auto

Почему LLM так сильны в математике: не проверка, а данные

Эксперты LessWrong опровергают миф о том, что верифицируемость ответов объясняет успех LLM в математике. Главный секрет — качество предобученных данных, а не RL.

Миф о верифицируемости

Распространенное мнение гласит, что большие языковые модели (LLM) особенно хороши в математике, потому что математические ответы легко проверить. Однако этот аргумент не выдерживает критики. Верифицируемость играет роль только на этапе обучения с подкреплением (RL), но ведущие компании-разработчики LLM заявляют, что уделяют этому этапу минимум внимания.

RLAIF вместо RLVR

Даже если компании применяют RL для улучшения математических навыков, они используют RLAIF (Reinforcement Learning from AI Feedback), а не RLVR (Reinforcement Learning from Verifiable Rewards). Это означает, что модель обучается не на основе строгой проверки правильности ответа, а на основе оценки качества аргументации другими ИИ-моделями. Таким образом, фраза «математику легко проверить» на деле сводится к «LLM хорошо умеют оценивать математические рассуждения».

Роль предобученных данных

Ключевой фактор успеха LLM в математике и программировании — это не процесс верификации, а качество и объем предобученных данных. Модели учатся имитировать решения, которые уже существуют в обучающих выборках. Если в данных много качественных математических задач и решений, модель научится их решать, независимо от того, насколько легко проверить итоговый ответ.

Сравнение подходов к обучению

Подход Описание Применение в LLM
RLVR Обучение с подкреплением на основе верифицируемых ответов Минимальное использование
RLAIF Обучение с подкреплением на основе обратной связи от ИИ Основной метод улучшения
Предобучение Имитационное обучение на больших наборах данных Ключевой фактор успеха

Вывод

Успех LLM в математике и программировании обусловлен не способностью проверять ответы, а качеством предобученных данных. Модели учатся имитировать решения, которые уже существуют в обучающих выборках, что делает предобучение более важным этапом, чем RL.

Источник: LessWrong ↗