Суть эксперимента: поиск инварианта вслепую
В работе, представленной на NeurIPS 2026 Workshop on Mathematical Reasoning and AI (MATH-AI), автор Yunus E. Zeytuncu ставит эксперимент по «перевскрытию» математической истины. В качестве полигона выбрана обобщенная кривая Бляшке (Blaschke curve) степени 4. AI-агенту не давали готовой теоремы; вместо этого он получал числовые координаты шести пар линий, определяемых 80 конфигурациями на границе области. Задача агента — найти закономерность, связывающую эти данные.
Результаты: от гипотез к точной цифре
Анализ логов исследования показывает, что агент последовательно отвергал геометрические гипотезы, пока не пришел к выводу о гомогенном кубическом многочлене, описывающем стороны многоугольника. Ключевой метрикой успеха стала проверка на новых данных: зафиксированные коэффициенты модели предсказали 480 линий для 80 новых значений параметров. Ошибка (RMS scale-free residual) составила феноменальные $8.88 imes10^{-17}$, что практически равно нулю в контексте численных вычислений.
Сравнение с базовым подходом
Важно отметить, что эксперимент не доказывает превосходство AI над традиционными методами. Пост-ревью детерминированный поиск по степеням (degree-search baseline) также успешно восстановил кубическую формулу. Это подчеркивает, что текущие агенты работают скорее как мощные инструменты валидации, а не как замена строгим алгоритмическим доказательствам.
| Метрика / Параметр | Значение / Результат |
|---|---|
| Объект исследования | Обобщенная кривая Бляшке (степень 4) |
| Объем обучающей выборки | 80 конфигураций границ |
| Найденная модель | Гомогенный кубический многочлен |
| Точность предсказания (RMS) | $8.88 imes10^{-17}$ |
| Тестовая выборка | 480 линий (80 новых параметров) |
| Альтернативный метод | Детерминированный поиск степеней (также успешен) |
Почему это важно для AI-сообщества
Работа позиционируется не как прорыв в автономном доказательстве теорем, а как протокол разделения этапов: выдвижение гипотезы, численная валидация и формальное доказательство. Автор честно указывает на ограничения: зависимость от метаданных агента, наличие скрытых prior-knowledge и проблемы воспроизводимости. Один из запусков с единичной конфигурацией даже показал «недостаточность доказательств» инвариантности, что служит предостережением против слепого доверия к числовым совпадениям.
Источник: arXiv cs.AI ↗
