Проблема ложной точности
В материаловедении оценка LLM сталкивается с фундаментальной проблемой: описание кристаллической структуры часто содержит сам ответ, который требуется предсказать. Стандартные метрики точности не способны отличить логический вывод от механического копирования. Авторы работы Jiajun Wu, Jian Yang и коллеги представили бенчмарк CARAT (Crystal Analysis and Reasoning Assessment Tool), который изолирует эти процессы.
Методология: 8 представлений и GraphSpace
Ключевое отличие CARAT — фиксация вопроса и правильного ответа при изменении 8 различных представлений структуры. Используется система GraphSpace для именования структурных отношений. Исследователи применили matched fine-tuning, маскирование ответов и правило отказа от утверждений (withhold claims), чтобы проверить, действительно ли модель использует данные или просто запоминает паттерны.
Ключевые метрики и провалы
Результаты показали, что базовые модели не способны к рассуждению. Вот как выглядят цифры, обнажающие обман:
| Метрика / Сценарий | Результат | Интерпретация |
|---|---|---|
| Прирост точности (Grounded view vs Formula) | +17.3 балла | Графическое представление критически важно, но модель не использует его осмысленно. |
| Преимущество GraphSpace над периодическим графом | +19.3 балла | 1.96 балла — реальное улучшение, 46.7 балла — артефакт наличия нужных полей в данных. |
| Доля случаев копирования (без обучения) | 95.6% | Модель повторяет отношение, не используя его для вывода. |
| Точность после matched supervision | 99.8% | Иллюзия успеха: модель выучила «шорткаты». |
| Точность при удалении ссылки (после обучения) | 23.4% | Падение ниже базового уровня (27.0%) доказывает отсутствие логики. |
Вывод: 11 из 11 шорткатов
Авторы атаковали собственный бенчмарк, найдя 11 способов обмана модели через прямое чтение списков. После обучения на этих шорткатах точность достигла 99.8%, но удаление ключевой ссылки сбрасывало её до 23.4%. Это доказывает, что текущие LLM в материаловедении не рассуждают, а эффективно цитируют входные данные.
Источник: arXiv cs.AI ↗
