Кризис оценки: от BLEU к семантике
Традиционные метрики, такие как BLEU и perplexity, измеряют лишь поверхностное совпадение токенов, не способные отличить глубокое понимание контекста от простого запоминания паттернов. Это создает критический пробел в оценке систем вопрос-ответ (QA), где важна фактическая согласованность, а не статистическая вероятность. Исследование, принятое к публикации в AACL-IJCNLP 2026, предлагает решение этой проблемы через призму структурной семантики.
Решение: S3KG и анализ на уровне триплетов
Авторы разработали фреймворк Semantic Structural Similarity for KGs (S3KG). В отличие от текстовых метрик, S3KG преобразует ответы моделей в графы знаний и вычисляет гибридную оценку, объединяя структурные и семантические сигналы. Дополнительно внедрен диагностический модуль, который классифицирует ошибки рассуждений на уровне триплетов (субъект-предикат-объект), позволяя точно локализовать сбои в логике модели.
Результаты: Превосходство над базовыми линиями
Эксперименты проводились на девяти различных бенчмарках. Использование S3KG позволило значительно повысить точность оценки качества ответов. Ниже приведены ключевые метрики эффективности новой системы по сравнению с сильнейшими существующими базовыми линиями:
| Метрика | Результат S3KG | Прирост над базовой линией |
|---|---|---|
| F1 Score | +7.6 пунктов | Максимальное улучшение |
| AUROC | 0.973 | Высокая дискриминационная способность |
Значение для индустрии
Работа Subavarshana Arumugam и коллег доказывает, что графы знаний могут служить надежным инструментом для диагностики «глубины» понимания у LLM. Это открывает путь к созданию более надежных систем QA, где важно не просто выдать правдоподобный текст, а обеспечить логическую целостность фактов, извлеченных из контекста.
Источник: arXiv cs.AI ↗
