Исследования2 октября 2026 г., 12:18 МСК🤖 Auto

Метод важнее темы: как улучшить математические навыки LLM

Исследование arXiv доказывает: для обучения LLM математике эффективнее подбирать примеры с похожим методом решения, а не из той же темы.

Баннер новости 8772

Парадигма отбора данных

Традиционно при подготовке данных для дообучения (fine-tuning) языковых моделей в математике использовалась логика «тема к теме»: примеры по теории вероятностей для задач по вероятностям. Авторы исследования из Университета Тегерана (Sajad Goudarzi, Samaneh Zamanifard и др.) предложили альтернативу — подбор по подходу к рассуждению (reasoning approach). Это означает, что модель обучают на задачах из другой области, но с идентичным методом решения целевой задачи.

Дизайн эксперимента

Для проверки гипотезы исследователи провели два контрбалансированных эксперимента, используя 2 000 и 800 задач соответственно. В каждом случае сравнивались два подхода:

  • Same-Approach (SA): источник и цель имеют одинаковый метод решения, но разные темы.
  • Same-Topic (ST): источник и цель имеют одинаковую тему, но разные методы решения.

В первой паре сравнивались вероятность и комбинаторика с методами инвариантного рассуждения и двойного счета. Во второй — теория чисел и геометрия с методами дополнения и принципа Дирихле.

Результаты: метод побеждает тему

Тестирование проводилось на пяти базовых моделях с тремя случайными зернами обучения. Результаты оказались однозначными: подход SA превосходит ST во всех 40 комбинациях. При этом разрыв в точности статистически значим (95% доверительные интервалы не включают ноль).

Дизайн эксперимента Пары тем Пары методов Преимущество SA над ST
Дизайн 1 Вероятность / Комбинаторика Инвариант / Двойной счет 8.2 – 16.2 п.п. (в среднем 10.8)
Дизайн 2 Теория чисел / Геометрия Дополнение / Принцип Дирихле 12.0 – 16.0 п.п. (в среднем 14.3)

Почему это важно

Ключевой инсайт заключается в том, что SA-источники объективно менее похожи на целевые задачи с точки зрения лексики и эмбеддингов, чем ST-источники. Тем не менее, именно они дают лучший результат. Это доказывает, что для математического мышления LLM критически важно переносить алгоритмические паттерны, а не просто запоминать терминологию конкретной области. Для разработчиков это означает, что при сборе датасетов для математических задач следует приоритизировать разнообразие тем при сохранении единого метода решения.

Источник: arXiv cs.AI ↗