Исследования1 октября 2026 г., 08:19 МСК🤖 Auto

CARAT: LLM в материаловедении не рассуждают, а цитируют

Исследование CARAT доказывает, что модели для материаловедения часто выдают за логику простое копирование из входных данных. Точность в 99.8% оказалась иллюзией, скрывающей отсутствие реального понимания.

Баннер новости 8668

Проблема ложной точности

В материаловедении оценка LLM сталкивается с фундаментальной проблемой: описание кристаллической структуры часто содержит сам ответ, который требуется предсказать. Стандартные метрики точности не способны отличить логический вывод от механического копирования. Авторы работы Jiajun Wu, Jian Yang и коллеги представили бенчмарк CARAT (Crystal Analysis and Reasoning Assessment Tool), который изолирует эти процессы.

Методология: 8 представлений и GraphSpace

Ключевое отличие CARAT — фиксация вопроса и правильного ответа при изменении 8 различных представлений структуры. Используется система GraphSpace для именования структурных отношений. Исследователи применили matched fine-tuning, маскирование ответов и правило отказа от утверждений (withhold claims), чтобы проверить, действительно ли модель использует данные или просто запоминает паттерны.

Ключевые метрики и провалы

Результаты показали, что базовые модели не способны к рассуждению. Вот как выглядят цифры, обнажающие обман:

Метрика / Сценарий Результат Интерпретация
Прирост точности (Grounded view vs Formula) +17.3 балла Графическое представление критически важно, но модель не использует его осмысленно.
Преимущество GraphSpace над периодическим графом +19.3 балла 1.96 балла — реальное улучшение, 46.7 балла — артефакт наличия нужных полей в данных.
Доля случаев копирования (без обучения) 95.6% Модель повторяет отношение, не используя его для вывода.
Точность после matched supervision 99.8% Иллюзия успеха: модель выучила «шорткаты».
Точность при удалении ссылки (после обучения) 23.4% Падение ниже базового уровня (27.0%) доказывает отсутствие логики.

Вывод: 11 из 11 шорткатов

Авторы атаковали собственный бенчмарк, найдя 11 способов обмана модели через прямое чтение списков. После обучения на этих шорткатах точность достигла 99.8%, но удаление ключевой ссылки сбрасывало её до 23.4%. Это доказывает, что текущие LLM в материаловедении не рассуждают, а эффективно цитируют входные данные.

Источник: arXiv cs.AI ↗