От теорем-пруфинга к вычислительной математике
Большинство современных исследований в области AI for Math сосредоточены на формализации теорем и их доказательстве. Однако роль систем компьютерной алгебры (CAS) в рабочих процессах агентов на базе больших языковых моделей (LLM) оставалась малоизученной. Авторы работы, представленной на AI for Math Workshop при ICML 2026, предлагают новый подход: ReAct-агент, объединяющий рассуждения LLM с верифицируемой обратной связью от SageMath и актуальной документацией Context7.
Методология и улучшение бенчмарка RealMath
Оценка проводилась на задачах исследовательского уровня из бенчмарка RealMath. Авторы не только протестировали модели, но и улучшили сам бенчмарк, внедрив многоэтапную процедуру постобработки и конвейер многоуровневой валидации. Это повысило надежность извлеченного набора задач и исключило ложноположительные результаты.
Ключевые метрики и сравнение моделей
Доступ к SageMath обеспечил существенный прирост производительности для всех протестированных моделей в среднем на +9.7 процентных пункта (pp). Разброс эффективности варьировался от 1.5 pp до 27.8 pp. Важно отметить, что использование CAS сгладило разрыв в качестве между моделями с открытым весом и закрытыми проприетарными решениями.
| Модель | Результат с SageMath | Ключевая характеристика |
|---|---|---|
| GPT-5.5 | 75.2% (решено задач) | Наивысшая точность и минимальное потребление токенов |
| Qwen 3.7-Max | Существенный прирост | Наибольшая выгода от интеграции SageMath |
| Средний показатель | +9.7 pp | Средний прирост точности по всем моделям |
Значение для науки
Результаты указывают на то, что агенты, дополненные CAS, являются перспективным направлением для помощи математикам в вычислительном исследовании. Авторы считают эту работу шагом в сторону автоматического обнаружения математических гипотез (conjecture discovery), что может трансформировать процесс научных открытий в области чистой математики.
Источник: arXiv cs.AI ↗
