Исследования31 августа 2026 г., 09:19 МСК🤖 Auto

INSPIRE: Как LLM учатся рассуждать, а не заучивать решения

Исследователи представили метод INSPIRE, который заставляет модели не просто угадывать ответы, а глубоко понимать математические концепции через примера.

Баннер новости 6397

Проблема: Иллюзия понимания

Современные большие языковые модели (LLM) демонстрируют впечатляющие результаты в решении математических задач, но исследователи из команды INSPIRE (Shuai Wang, Jiayi Kuang и др.) отмечают критический недостаток: оптимизация идет преимущественно на точность финального ответа. Это приводит к тому, что модели часто запоминают паттерны решений, а не усваивают сами математические концепции. В отличие от людей, которые используют контрпримеры для проверки границ теорем, LLM пока слабо справляются с примеро-управляемым рассуждением (example-driven reasoning).

Решение: Методология Internalize-Then-Improve

Авторы предлагают новый подход INSPIRE, состоящий из двух ключевых этапов:

  • Reference-Guided Student Internalization (RGSI): Модель генерирует высококачественные кандидаты на основе собственного распределения, используя примеры как руководство. Это решает проблему создания эффективных пар предпочтений, когда способность модели к рассуждению еще ограничена.
  • Stage-wise Rubric Preference Training: Обучение разбивается на два этапа. Сначала модель учится применять стратегию рассуждения (method-oriented), а затем оптимизируется на правильность ответа (correctness-oriented). Это учитывает прогрессивный характер приобретения навыков.

Результаты: Превосходство над аналогами

Эксперименты проводились на моделях разных масштабов и семейств. INSPIRE демонстрирует стабильное улучшение результатов, превосходя более крупные открытые модели. Важно, что тесты на выборке вне распределения (out-of-distribution benchmarks) подтвердили: улучшение примеро-управляемого рассуждения не привело к деградации общих способностей модели к математическому мышлению.

Критерий Описание
Основной метод Internalize-Then-Improve (Сначала усвоить, затем улучшить)
Ключевая техника Reference-Guided Student Internalization (RGSI)
Стратегия обучения Двухэтапная: сначала метод, потом точность
Влияние на общие навыки Отрицательной деградации не выявлено
Веню публикации EMNLP 2026

Почему это важно

INSPIRE закрывает важный пробел в обучении LLM, переводя их с уровня «паттерн-матчинга» на уровень концептуального понимания. Это критически важно для применения ИИ в сложных научных и инженерных задачах, где важна не только цифра, но и логика вывода.

Источник: arXiv cs.CL ↗