Миф о верифицируемости
Распространенное мнение гласит, что большие языковые модели (LLM) особенно хороши в математике, потому что математические ответы легко проверить. Однако этот аргумент не выдерживает критики. Верифицируемость играет роль только на этапе обучения с подкреплением (RL), но ведущие компании-разработчики LLM заявляют, что уделяют этому этапу минимум внимания.
RLAIF вместо RLVR
Даже если компании применяют RL для улучшения математических навыков, они используют RLAIF (Reinforcement Learning from AI Feedback), а не RLVR (Reinforcement Learning from Verifiable Rewards). Это означает, что модель обучается не на основе строгой проверки правильности ответа, а на основе оценки качества аргументации другими ИИ-моделями. Таким образом, фраза «математику легко проверить» на деле сводится к «LLM хорошо умеют оценивать математические рассуждения».
Роль предобученных данных
Ключевой фактор успеха LLM в математике и программировании — это не процесс верификации, а качество и объем предобученных данных. Модели учатся имитировать решения, которые уже существуют в обучающих выборках. Если в данных много качественных математических задач и решений, модель научится их решать, независимо от того, насколько легко проверить итоговый ответ.
Сравнение подходов к обучению
| Подход | Описание | Применение в LLM |
|---|---|---|
| RLVR | Обучение с подкреплением на основе верифицируемых ответов | Минимальное использование |
| RLAIF | Обучение с подкреплением на основе обратной связи от ИИ | Основной метод улучшения |
| Предобучение | Имитационное обучение на больших наборах данных | Ключевой фактор успеха |
Вывод
Успех LLM в математике и программировании обусловлен не способностью проверять ответы, а качеством предобученных данных. Модели учатся имитировать решения, которые уже существуют в обучающих выборках, что делает предобучение более важным этапом, чем RL.
Источник: LessWrong ↗