Исследования5 сентября 2026 г., 03:17 МСК🤖 Auto

KC-Bench: Почему LLM-агенты проваливают проверку фактов

Исследователи представили KC-Bench — динамический бенчмарк для оценки способности LLM разрешать конфликты знаний. Ни одна из протестированных моделей не справилась со всеми типами противоречий.

Баннер новости 6821

Проблема: Конфликт знаний в агентах

По мере того как большие языковые модели (LLM) всё чаще действуют через инструменты (tools), они сталкиваются с критической проблемой: необходимо согласовывать инструкции пользователя, параметрические знания модели и динамические наблюдения из окружающей среды. Исследователи из команды, возглавляемой Ясин Люй (Yaxing Lyu), представили KC-Bench — контролируемый многошаговый бенчмарк, специально созданный для измерения этой способности.

В отличие от стандартных тестов, KC-Bench фокусируется на трех типах конфликтов:

  • Конфликты мировых знаний: когда факты в базе знаний модели противоречат текущей ситуации.
  • Несогласованность ввода: противоречия внутри самого запроса пользователя.
  • Временные конфликты: когда информация из разных источников имеет разные временные метки.

Методология: 238 задач и строгая верификация

Бенчмарк не полагается на субъективную оценку. Он включает:

  1. Симулятор пользователя: генерирует реалистичные сценарии.
  2. Инструменты с сохранением состояния: моделируют взаимодействие с внешним миром.
  3. Детерминированные утверждения среды: четкие критерии успеха/неудачи.
  4. Открытый оценщик на естественном языке: анализирует логику ответов.
  5. Верификацию траекторий человеком: ручная проверка сложных случаев.

Всего в датасет вошло 238 задач, вручную отобранных из более чем 1000 сгенерированных кандидатов. Это позволяет изолировать поведение модели на уровне отдельных решений, а не оценивать целостность целых агентных фреймворков.

Результаты: Провал топовых моделей

Исследователи протестировали девять современных моделей, включая DeepSeek-V4-Flash, GLM-5.2 и MiniMax-M3. Результаты показали существенные различия между доменами, но главный вывод пессимистичен: ни одна модель не способна надежно разрешать конфликты фактов, проверять согласованность идентичности и разрешать временные противоречия одновременно во всех сценариях.

Тип конфликта Суть проблемы Риск при игнорировании
Фактическая коррекция Модель должна опровергнуть устаревшие или ложные данные из своей памяти Галлюцинации, передача неверных данных
Проверка идентичности Сохранение согласованности роли/персоны в многошаговом диалоге Нарушение безопасности, утечка контекста
Временные конфликты Разрешение противоречий между данными с разными временными метками Использование устаревших инструкций

Почему это важно

В симулируемых средах пропущенные конфликты могут привести к ошибочным вызовам инструментов (tool calls) или утечке синтетически защищенных данных. KC-Bench предоставляет воспроизводимую диагностическую базу для разработчиков, позволяя создавать механизмы защиты (safeguards), aware к конфликтам знаний. Это шаг от простого «ответа на вопрос» к надежному «принятию решений в условиях неопределенности».

Источник: arXiv cs.AI ↗