Исследования12 августа 2026 г., 11:17 МСК🤖 Auto

TRACE: Как качество поиска спасает чат-боты от галлюцинаций

Исследователи представили TRACE — систему, которая использует графы знаний и строгие ограничения для фильтрации шума в базах данных госуслуг, радикально снижая уровень выдуманных ответов LLM.

Баннер новости 5595

Проблема: Шум в данных убивает доверие

Публичные сервисные чат-боты часто сталкиваются с критической проблемой: базы данных государственных услуг (например, реестры продовольственных складов или социальных центров) зашумлены, противоречивы и неструктурированы. Обычные LLM, пытаясь помочь пользователю, игнорируют явные ограничения (например, «нужен пункт только в этом районе») и генерируют галлюцинированные рекомендации, ссылаясь на несуществующие или неверные источники. Это делает такие системы опасными для реального использования в социальной сфере.

Решение: TRACE и двойная репрезентация

Команда авторов (Touseef Hasan, Laila Cure, Souvika Sarkar) предложила архитектуру TRACE (Trustworthy Retrieval-Augmented Conversational Engine). Ключевая инновация — парсинг запроса пользователя на две составляющие: структурные и семантические ограничения. Для этого используется двойная схема представления данных, позволяющая системе четко отделять факты от интерпретаций до того, как они попадут в генератор ответа.

Эксперимент: Графы знаний против плоских данных

Для проверки гипотезы исследователи использовали курируемую statewide pantry directory (реестр продовольственных складов штата) и синтетический бенчмарк запросов. Они сравнивали варианты извлечения знаний с использованием графов знаний (KG) и без них, тестируя как открытые, так и проприетарные LLM. Результаты показали, что внедрение графов знаний и усиление качества поиска (retrieval quality) напрямую коррелирует с выполнением пользовательских ограничений.

Параметр Без усиленного поиска (Baseline) С TRACE (усиленный поиск + KG)
Уровень галлюцинаций Высокий (частые несуществующие адреса) Значительно снижен
Соблюдение ограничений Низкое (игнорирование фильтров) Высокое (точное соответствие критериям)
Зависимость от модели Сильная (разрыв между small и large LLM) Минимальная (результаты выравниваются)

Главный вывод: Поиск важнее размера модели

Самое важное открытие исследования заключается в том, что при улучшении качества этапа извлечения информации (retrieval), разрыв в производительности между различными LLM сужается. Это означает, что для надежных публичных сервисов критически важна не мощность самой нейросети, а качество подготовки и фильтрации данных, которые она получает. TRACE доказывает, что правильная архитектура поиска может компенсировать недостатки даже относительно небольших открытых моделей.

Источник: arXiv cs.AI ↗