Парадигма отбора данных
Традиционно при подготовке данных для дообучения (fine-tuning) языковых моделей в математике использовалась логика «тема к теме»: примеры по теории вероятностей для задач по вероятностям. Авторы исследования из Университета Тегерана (Sajad Goudarzi, Samaneh Zamanifard и др.) предложили альтернативу — подбор по подходу к рассуждению (reasoning approach). Это означает, что модель обучают на задачах из другой области, но с идентичным методом решения целевой задачи.
Дизайн эксперимента
Для проверки гипотезы исследователи провели два контрбалансированных эксперимента, используя 2 000 и 800 задач соответственно. В каждом случае сравнивались два подхода:
- Same-Approach (SA): источник и цель имеют одинаковый метод решения, но разные темы.
- Same-Topic (ST): источник и цель имеют одинаковую тему, но разные методы решения.
В первой паре сравнивались вероятность и комбинаторика с методами инвариантного рассуждения и двойного счета. Во второй — теория чисел и геометрия с методами дополнения и принципа Дирихле.
Результаты: метод побеждает тему
Тестирование проводилось на пяти базовых моделях с тремя случайными зернами обучения. Результаты оказались однозначными: подход SA превосходит ST во всех 40 комбинациях. При этом разрыв в точности статистически значим (95% доверительные интервалы не включают ноль).
| Дизайн эксперимента | Пары тем | Пары методов | Преимущество SA над ST |
|---|---|---|---|
| Дизайн 1 | Вероятность / Комбинаторика | Инвариант / Двойной счет | 8.2 – 16.2 п.п. (в среднем 10.8) |
| Дизайн 2 | Теория чисел / Геометрия | Дополнение / Принцип Дирихле | 12.0 – 16.0 п.п. (в среднем 14.3) |
Почему это важно
Ключевой инсайт заключается в том, что SA-источники объективно менее похожи на целевые задачи с точки зрения лексики и эмбеддингов, чем ST-источники. Тем не менее, именно они дают лучший результат. Это доказывает, что для математического мышления LLM критически важно переносить алгоритмические паттерны, а не просто запоминать терминологию конкретной области. Для разработчиков это означает, что при сборе датасетов для математических задач следует приоритизировать разнообразие тем при сохранении единого метода решения.
Источник: arXiv cs.AI ↗
