Проблема: Иллюзия понимания
Современные большие языковые модели (LLM) демонстрируют впечатляющие результаты в решении математических задач, но исследователи из команды INSPIRE (Shuai Wang, Jiayi Kuang и др.) отмечают критический недостаток: оптимизация идет преимущественно на точность финального ответа. Это приводит к тому, что модели часто запоминают паттерны решений, а не усваивают сами математические концепции. В отличие от людей, которые используют контрпримеры для проверки границ теорем, LLM пока слабо справляются с примеро-управляемым рассуждением (example-driven reasoning).
Решение: Методология Internalize-Then-Improve
Авторы предлагают новый подход INSPIRE, состоящий из двух ключевых этапов:
- Reference-Guided Student Internalization (RGSI): Модель генерирует высококачественные кандидаты на основе собственного распределения, используя примеры как руководство. Это решает проблему создания эффективных пар предпочтений, когда способность модели к рассуждению еще ограничена.
- Stage-wise Rubric Preference Training: Обучение разбивается на два этапа. Сначала модель учится применять стратегию рассуждения (method-oriented), а затем оптимизируется на правильность ответа (correctness-oriented). Это учитывает прогрессивный характер приобретения навыков.
Результаты: Превосходство над аналогами
Эксперименты проводились на моделях разных масштабов и семейств. INSPIRE демонстрирует стабильное улучшение результатов, превосходя более крупные открытые модели. Важно, что тесты на выборке вне распределения (out-of-distribution benchmarks) подтвердили: улучшение примеро-управляемого рассуждения не привело к деградации общих способностей модели к математическому мышлению.
| Критерий | Описание |
|---|---|
| Основной метод | Internalize-Then-Improve (Сначала усвоить, затем улучшить) |
| Ключевая техника | Reference-Guided Student Internalization (RGSI) |
| Стратегия обучения | Двухэтапная: сначала метод, потом точность |
| Влияние на общие навыки | Отрицательной деградации не выявлено |
| Веню публикации | EMNLP 2026 |
Почему это важно
INSPIRE закрывает важный пробел в обучении LLM, переводя их с уровня «паттерн-матчинга» на уровень концептуального понимания. Это критически важно для применения ИИ в сложных научных и инженерных задачах, где важна не только цифра, но и логика вывода.
Источник: arXiv cs.CL ↗
