Проблема: от чисел к структуре
В теоретической физике ключевой навык — распознать, что новая задача сводится к известной модели. Авторы работы, опубликованной на arXiv (29 июля 2026 г.), исследуют, могут ли AI-агенты на базе больших языковых моделей (LLM) самостоятельно преобразовывать сырые функции распределения в разрешимые представления. Для этого создан StatMechBench-v0 — набор из шести задач типа модели Изинга, охватывающих методы матрицы переноса, устранимую калибровочную неупорядоченность и планарные/Пфаффианские структуры.
Методология: цикл «Предложить-Проверить-Исправить»
Эксперимент оценивал простого агента, работающего по схеме propose-verify-revise (предложить — проверить — исправить), на различных LLM. Агентам давались задачи в разных формулировках, а обратная связь предоставлялась в числовом виде. Цель — увидеть, сможет ли ИИ не просто выдать код, а найти верную физическую структуру задачи.
Результаты: иллюзия успеха
Результаты выявили критический разрыв между численной точностью и физическим пониманием. Хотя численная обратная связь помогала агентам исправлять ошибки в коде, это не гарантировало правильности вывода. Агенты могли пройти числовые проверки, но при этом:
- Неверно идентифицировать класс разрешимости модели;
- Недооценивать вычислительную сложность задачи.
Детали бенчмарка
StatMechBench-v0 фокусируется на сложных структурных аспектах, где традиционные методы проверки кода недостаточны. Ниже приведена структура тестовых задач:
| Категория задачи | Описание метода | Сложность проверки |
|---|---|---|
| Метод матрицы переноса | Сведение к собственным значениям | Высокая (требует структурного инсайта) |
| Устранимая неупорядоченность | Калибровочные преобразования | Средняя/Высокая |
| Планарные/Пфаффиан структуры | Топологические свойства решетки | Критическая (число не спасает) |
Вывод: нужен стек верификации
Исследование показывает, что текущие LLM не обладают достаточным логическим аппаратом для самостоятельного открытия структур в физике. Авторы предлагают перейти от простой числовой проверки к многоуровневому стеку верификации, включающему символьные проверки и анализ структурных инвариантов. Работа принята к публикации на воркшопе AID-Wild в рамках конференции CAIS 2026.
Источник: arXiv cs.AI ↗
