Исследования20 августа 2026 г., 07:19 МСК🤖 Auto

Solving Is Not Drawing: AI не умеет строить чертежи

Новый бенчмарк из ICML 2026 доказывает: мощные LLM решают олимпиадные задачи по геометрии, но не могут построить точный чертеж. Разрыв между логикой и визуализацией оказался критическим.

Баннер новости 6134

Проблема: «Решить» ≠ «Нарисовать»

Фундаментальные модели, такие как GPT и Claude, демонстрируют выдающиеся результаты в решении математических задач уровня олимпиад. Однако исследователи из команды Hsien Xin Peng, Anthony Kim и других авторов отмечают, что способность выводить правильный ответ не гарантирует умение построить необходимую геометрическую фигуру. В геометрии успех часто зависит от точности вспомогательных построений и инцидентностей, которые модели игнорируют.

Существующие бенчмарки, такие как MathVista и MathVerse, измеряют только финальный ответ. Никто ранее не изолировал способность модели к самостоятельному созданию диаграммы. Этот пробел заполнен новым открытым набором данных, представленным на воркшопе AI4MATH при ICML 2026.

Детали бенчмарка: 954 задачи и Asymptote

Авторы представили специализированный датасет, содержащий 954 самодостаточные задачи по олимпиадной геометрии. Ключевая особенность — каждая задача сопровождается:

  • Человеко-авторским, высокодетализированным чертежом.
  • Кодом на языке Asymptote, который можно рендерить.
  • Полным решением задачи.

Для оценки выделено 297 сложных задач. Метрики охватывают не только текстовые ответы, но и проверку кода, изображений, мультимодальных моделей (VLM) и геометрических ограничений.

Результаты: провал моделей

Тестирование текущих фундаментальных моделей выявило серьезный разрыв. Несмотря на способность логически решать задачи, модели генерируют чертежи с низкой точностью. Средний процент успешной компиляции кода Asymptote составил всего 36.14%. Это означает, что в большинстве случаев модель либо не понимает пространственных отношений, либо не может перевести их в корректный программный код для рисования.

Сравнение подходов к оценке

Критерий Стандартные бенчмарки (MathVista/MathVerse) Новый бенчмарк (Solving Is Not Drawing)
Фокус оценки Только финальный ответ Точность построения чертежа и кода
Метрика успеха Совпадение с эталоном ответа Compile success rate (успешность компиляции Asymptote)
Результат для LLM Высокая точность решения Низкая верность диаграмм (~36%)

Вывод

Исследование доказывает: сильное математическое рассуждение не подразумевает способности к точной визуализации. Для развития AI в STEM необходимо отдельно обучать модели работе с геометрическими конструкциями и кодом генерации изображений, а не только текстовым выводом. Датасет и код доступны для сообщества.

Источник: arXiv cs.AI ↗