Исследования19 августа 2026 г., 10:17 МСК🤖 Auto

KnowSim: Как симуляторы пользователей выявляют реальную адекватность LLM

Исследователи представили KnowSim — фреймворк для оценки информационной калибровки LLM, который показывает, что лучшие модели зависят от уровня знаний пользователя, а стандартные тесты это упускают.

Баннер новости 6052

Проблема: LLM не учитывают эволюцию знаний пользователя

Для эффективного сотрудничества в задачах, требующих глубоких знаний, большие языковые модели (LLM) должны выполнять информационную калибровку — адаптировать контент под текущее понимание и когнитивные способности пользователя. Однако существующие симуляторы пользователей (user simulators) не моделируют состояние знаний явно. Они не могут воспроизвести реалистичные взаимодействия на разных уровнях компетенции и не отражают динамику обучения.

Решение: KnowSim с графом знаний

Команда авторов во главе с Юнжу Ли (Yoonjoo Lee) представила KnowSim — фреймворк, основанный на симуляторе пользователя, который поддерживает явное состояние знаний. Это состояние представлено в виде графа информационных единиц (Information Units) с отношениями предпосылок (prerequisites). Состояние эволюционирует по правилам, основанным на теории обучения.

KnowSim вычисляет три ключевые метрики, отражающие механизмы калибровки:

  • Knowledge Gain (Прирост знаний): насколько пользователь узнал нового.
  • Delivery Calibration (Калибровка доставки): насколько ответ модели соответствует уровню понимания.
  • Cognitive Overload (Когнитивная перегрузка): индекс того, превышает ли сложность ответа возможности пользователя.

Валидация: 705 сессий с людьми

Эффективность KnowSim была проверена на 705 сессиях взаимодействия человека и ИИ в двух предметных областях. Результаты ранжирования KnowSim статистически значимо совпали с человеческими суждениями в 73–74% случаев (sign agreement), превзойдя три базовых симулятора.

Результаты тестирования 9 моделей LLM

Применение фреймворка к 9 различным LLM выявило критический недостаток стандартных оценок: лучшая модель меняется в зависимости от уровня знаний пользователя. Это явление, известное как aptitude-treatment interactions (взаимодействие способностей и методов лечения/обучения), остается невидимым для традиционных бенчмарков, которые часто усредняют результаты.

Метрика KnowSim Что измеряет Значение для разработчиков
Knowledge Gain Прирост компетенции пользователя Оценка образовательной ценности ассистента
Delivery Calibration Соответствие ответа уровню пользователя Поиск баланса между простотой и точностью
Cognitive Overload Превышение когнитивной нагрузки Предотвращение отторжения сложной информации

Почему это важно

Стандартные бенчмарки часто оценивают LLM по абсолютной точности фактов, игнорируя контекст пользователя. KnowSim доказывает, что «лучшая» модель — понятие относительное. Для создания по-настоящему полезных ассистентов необходимо оценивать не только то, что модель знает, но и то, как она адаптирует свои ответы под эволюционирующее состояние знаний собеседника.

Источник: arXiv cs.AI ↗