Проблема: Шум в данных убивает доверие
Публичные сервисные чат-боты часто сталкиваются с критической проблемой: базы данных государственных услуг (например, реестры продовольственных складов или социальных центров) зашумлены, противоречивы и неструктурированы. Обычные LLM, пытаясь помочь пользователю, игнорируют явные ограничения (например, «нужен пункт только в этом районе») и генерируют галлюцинированные рекомендации, ссылаясь на несуществующие или неверные источники. Это делает такие системы опасными для реального использования в социальной сфере.
Решение: TRACE и двойная репрезентация
Команда авторов (Touseef Hasan, Laila Cure, Souvika Sarkar) предложила архитектуру TRACE (Trustworthy Retrieval-Augmented Conversational Engine). Ключевая инновация — парсинг запроса пользователя на две составляющие: структурные и семантические ограничения. Для этого используется двойная схема представления данных, позволяющая системе четко отделять факты от интерпретаций до того, как они попадут в генератор ответа.
Эксперимент: Графы знаний против плоских данных
Для проверки гипотезы исследователи использовали курируемую statewide pantry directory (реестр продовольственных складов штата) и синтетический бенчмарк запросов. Они сравнивали варианты извлечения знаний с использованием графов знаний (KG) и без них, тестируя как открытые, так и проприетарные LLM. Результаты показали, что внедрение графов знаний и усиление качества поиска (retrieval quality) напрямую коррелирует с выполнением пользовательских ограничений.
| Параметр | Без усиленного поиска (Baseline) | С TRACE (усиленный поиск + KG) |
|---|---|---|
| Уровень галлюцинаций | Высокий (частые несуществующие адреса) | Значительно снижен |
| Соблюдение ограничений | Низкое (игнорирование фильтров) | Высокое (точное соответствие критериям) |
| Зависимость от модели | Сильная (разрыв между small и large LLM) | Минимальная (результаты выравниваются) |
Главный вывод: Поиск важнее размера модели
Самое важное открытие исследования заключается в том, что при улучшении качества этапа извлечения информации (retrieval), разрыв в производительности между различными LLM сужается. Это означает, что для надежных публичных сервисов критически важна не мощность самой нейросети, а качество подготовки и фильтрации данных, которые она получает. TRACE доказывает, что правильная архитектура поиска может компенсировать недостатки даже относительно небольших открытых моделей.
Источник: arXiv cs.AI ↗
