Проблема: «Решить» ≠ «Нарисовать»
Фундаментальные модели, такие как GPT и Claude, демонстрируют выдающиеся результаты в решении математических задач уровня олимпиад. Однако исследователи из команды Hsien Xin Peng, Anthony Kim и других авторов отмечают, что способность выводить правильный ответ не гарантирует умение построить необходимую геометрическую фигуру. В геометрии успех часто зависит от точности вспомогательных построений и инцидентностей, которые модели игнорируют.
Существующие бенчмарки, такие как MathVista и MathVerse, измеряют только финальный ответ. Никто ранее не изолировал способность модели к самостоятельному созданию диаграммы. Этот пробел заполнен новым открытым набором данных, представленным на воркшопе AI4MATH при ICML 2026.
Детали бенчмарка: 954 задачи и Asymptote
Авторы представили специализированный датасет, содержащий 954 самодостаточные задачи по олимпиадной геометрии. Ключевая особенность — каждая задача сопровождается:
- Человеко-авторским, высокодетализированным чертежом.
- Кодом на языке Asymptote, который можно рендерить.
- Полным решением задачи.
Для оценки выделено 297 сложных задач. Метрики охватывают не только текстовые ответы, но и проверку кода, изображений, мультимодальных моделей (VLM) и геометрических ограничений.
Результаты: провал моделей
Тестирование текущих фундаментальных моделей выявило серьезный разрыв. Несмотря на способность логически решать задачи, модели генерируют чертежи с низкой точностью. Средний процент успешной компиляции кода Asymptote составил всего 36.14%. Это означает, что в большинстве случаев модель либо не понимает пространственных отношений, либо не может перевести их в корректный программный код для рисования.
Сравнение подходов к оценке
| Критерий | Стандартные бенчмарки (MathVista/MathVerse) | Новый бенчмарк (Solving Is Not Drawing) |
|---|---|---|
| Фокус оценки | Только финальный ответ | Точность построения чертежа и кода |
| Метрика успеха | Совпадение с эталоном ответа | Compile success rate (успешность компиляции Asymptote) |
| Результат для LLM | Высокая точность решения | Низкая верность диаграмм (~36%) |
Вывод
Исследование доказывает: сильное математическое рассуждение не подразумевает способности к точной визуализации. Для развития AI в STEM необходимо отдельно обучать модели работе с геометрическими конструкциями и кодом генерации изображений, а не только текстовым выводом. Датасет и код доступны для сообщества.
Источник: arXiv cs.AI ↗
