Исследования31 июля 2026 г., 10:16 МСК🤖 Auto

AI-агенты в статистической физике: новый бенчмарк StatMechBench-v0

Исследователи представили StatMechBench-v0 — первый специализированный бенчмарк для оценки способности LLM-агентов находить математические соответствия в задачах статистической механики.

Баннер новости 4788

Проблема: от чисел к структуре

В теоретической физике ключевой навык — распознать, что новая задача сводится к известной модели. Авторы работы, опубликованной на arXiv (29 июля 2026 г.), исследуют, могут ли AI-агенты на базе больших языковых моделей (LLM) самостоятельно преобразовывать сырые функции распределения в разрешимые представления. Для этого создан StatMechBench-v0 — набор из шести задач типа модели Изинга, охватывающих методы матрицы переноса, устранимую калибровочную неупорядоченность и планарные/Пфаффианские структуры.

Методология: цикл «Предложить-Проверить-Исправить»

Эксперимент оценивал простого агента, работающего по схеме propose-verify-revise (предложить — проверить — исправить), на различных LLM. Агентам давались задачи в разных формулировках, а обратная связь предоставлялась в числовом виде. Цель — увидеть, сможет ли ИИ не просто выдать код, а найти верную физическую структуру задачи.

Результаты: иллюзия успеха

Результаты выявили критический разрыв между численной точностью и физическим пониманием. Хотя численная обратная связь помогала агентам исправлять ошибки в коде, это не гарантировало правильности вывода. Агенты могли пройти числовые проверки, но при этом:

  • Неверно идентифицировать класс разрешимости модели;
  • Недооценивать вычислительную сложность задачи.

Детали бенчмарка

StatMechBench-v0 фокусируется на сложных структурных аспектах, где традиционные методы проверки кода недостаточны. Ниже приведена структура тестовых задач:

Категория задачи Описание метода Сложность проверки
Метод матрицы переноса Сведение к собственным значениям Высокая (требует структурного инсайта)
Устранимая неупорядоченность Калибровочные преобразования Средняя/Высокая
Планарные/Пфаффиан структуры Топологические свойства решетки Критическая (число не спасает)

Вывод: нужен стек верификации

Исследование показывает, что текущие LLM не обладают достаточным логическим аппаратом для самостоятельного открытия структур в физике. Авторы предлагают перейти от простой числовой проверки к многоуровневому стеку верификации, включающему символьные проверки и анализ структурных инвариантов. Работа принята к публикации на воркшопе AID-Wild в рамках конференции CAIS 2026.

Источник: arXiv cs.AI ↗