Проблема: Конфликт знаний в агентах
По мере того как большие языковые модели (LLM) всё чаще действуют через инструменты (tools), они сталкиваются с критической проблемой: необходимо согласовывать инструкции пользователя, параметрические знания модели и динамические наблюдения из окружающей среды. Исследователи из команды, возглавляемой Ясин Люй (Yaxing Lyu), представили KC-Bench — контролируемый многошаговый бенчмарк, специально созданный для измерения этой способности.
В отличие от стандартных тестов, KC-Bench фокусируется на трех типах конфликтов:
- Конфликты мировых знаний: когда факты в базе знаний модели противоречат текущей ситуации.
- Несогласованность ввода: противоречия внутри самого запроса пользователя.
- Временные конфликты: когда информация из разных источников имеет разные временные метки.
Методология: 238 задач и строгая верификация
Бенчмарк не полагается на субъективную оценку. Он включает:
- Симулятор пользователя: генерирует реалистичные сценарии.
- Инструменты с сохранением состояния: моделируют взаимодействие с внешним миром.
- Детерминированные утверждения среды: четкие критерии успеха/неудачи.
- Открытый оценщик на естественном языке: анализирует логику ответов.
- Верификацию траекторий человеком: ручная проверка сложных случаев.
Всего в датасет вошло 238 задач, вручную отобранных из более чем 1000 сгенерированных кандидатов. Это позволяет изолировать поведение модели на уровне отдельных решений, а не оценивать целостность целых агентных фреймворков.
Результаты: Провал топовых моделей
Исследователи протестировали девять современных моделей, включая DeepSeek-V4-Flash, GLM-5.2 и MiniMax-M3. Результаты показали существенные различия между доменами, но главный вывод пессимистичен: ни одна модель не способна надежно разрешать конфликты фактов, проверять согласованность идентичности и разрешать временные противоречия одновременно во всех сценариях.
| Тип конфликта | Суть проблемы | Риск при игнорировании |
|---|---|---|
| Фактическая коррекция | Модель должна опровергнуть устаревшие или ложные данные из своей памяти | Галлюцинации, передача неверных данных |
| Проверка идентичности | Сохранение согласованности роли/персоны в многошаговом диалоге | Нарушение безопасности, утечка контекста |
| Временные конфликты | Разрешение противоречий между данными с разными временными метками | Использование устаревших инструкций |
Почему это важно
В симулируемых средах пропущенные конфликты могут привести к ошибочным вызовам инструментов (tool calls) или утечке синтетически защищенных данных. KC-Bench предоставляет воспроизводимую диагностическую базу для разработчиков, позволяя создавать механизмы защиты (safeguards), aware к конфликтам знаний. Это шаг от простого «ответа на вопрос» к надежному «принятию решений в условиях неопределенности».
Источник: arXiv cs.AI ↗
