Проблема «разделяй и властвуй»
Современные методы оценки фактологичности больших языковых моделей (LLM) часто опираются на парадигму «decompose-then-verify» (разложи, затем проверь). Однако этот подход сталкивается с фундаментальным компромиссом: атомарные факты (одна единица информации в предложении) часто теряют необходимый контекст, а широкие утверждения не имеют достаточной детализации для точной оценки. Это приводит к ложным срабатываниям или пропуску ошибок.
Решение: TriQua и гиперреляционные факты
Авторы — Jin Liu, Steffen Thoma и Achim Rettinger — предлагают фреймворк TriQua, который гибко моделирует факты в зависимости от их сложности. Вместо жесткой атомаризации система использует адаптивную структуру:
- Простые утверждения извлекаются как стандартные тройки (subject-predicate-object).
- Сложные утверждения представляются в виде гиперреляционных фактов, где к базовой тройке прикрепляются вспомогательные контекстуальные квалификаторы (auxiliary contextual qualifiers).
Такой подход сохраняет контекст, необходимый для точного поиска доказательств, не жертвуя при этом атомарностью, что критично для верификации.
Метрика TriQuaScore и объяснимость
Ключевым элементом системы является метрика TriQuaScore, которая количественно оценивает фактологичность структурированных единиц фактов. В отличие от черных ящиков, TriQua позволяет напрямую аннотировать конкретные ошибки в определенных тройках и квалификаторах, обеспечивая тонкую объяснимость (fine-grained explainability) при обнаружении галлюцинаций.
Результаты и сравнение
Эмпирические оценки показывают, что TriQuaScore имеет сильную корреляцию с человеческими оценками фактологичности. Фреймворк демонстрирует устойчивое качество декомпозиции и превосходит существующие подходы, основанные на декомпозиции, в задачах верификации фактов на основе доказательств (evidence-based fact verification).
| Характеристика | Стандартная атомарная декомпозиция | TriQua (Гиперреляционная модель) |
|---|---|---|
| Структура данных | Стандартные тройки (S-P-O) | Тройки + контекстуальные квалификаторы |
| Сохранение контекста | Низкое (часто теряется) | Высокое (адаптивно) |
| Точность верификации | Средняя (риск ложных срабатываний) | Высокая (превосходит аналоги) |
| Объяснимость ошибок | Общая | Тонкая (локализация в квалификаторах) |
Источник: arXiv cs.AI ↗
