Проблема: LLM не учитывают эволюцию знаний пользователя
Для эффективного сотрудничества в задачах, требующих глубоких знаний, большие языковые модели (LLM) должны выполнять информационную калибровку — адаптировать контент под текущее понимание и когнитивные способности пользователя. Однако существующие симуляторы пользователей (user simulators) не моделируют состояние знаний явно. Они не могут воспроизвести реалистичные взаимодействия на разных уровнях компетенции и не отражают динамику обучения.
Решение: KnowSim с графом знаний
Команда авторов во главе с Юнжу Ли (Yoonjoo Lee) представила KnowSim — фреймворк, основанный на симуляторе пользователя, который поддерживает явное состояние знаний. Это состояние представлено в виде графа информационных единиц (Information Units) с отношениями предпосылок (prerequisites). Состояние эволюционирует по правилам, основанным на теории обучения.
KnowSim вычисляет три ключевые метрики, отражающие механизмы калибровки:
- Knowledge Gain (Прирост знаний): насколько пользователь узнал нового.
- Delivery Calibration (Калибровка доставки): насколько ответ модели соответствует уровню понимания.
- Cognitive Overload (Когнитивная перегрузка): индекс того, превышает ли сложность ответа возможности пользователя.
Валидация: 705 сессий с людьми
Эффективность KnowSim была проверена на 705 сессиях взаимодействия человека и ИИ в двух предметных областях. Результаты ранжирования KnowSim статистически значимо совпали с человеческими суждениями в 73–74% случаев (sign agreement), превзойдя три базовых симулятора.
Результаты тестирования 9 моделей LLM
Применение фреймворка к 9 различным LLM выявило критический недостаток стандартных оценок: лучшая модель меняется в зависимости от уровня знаний пользователя. Это явление, известное как aptitude-treatment interactions (взаимодействие способностей и методов лечения/обучения), остается невидимым для традиционных бенчмарков, которые часто усредняют результаты.
| Метрика KnowSim | Что измеряет | Значение для разработчиков |
|---|---|---|
| Knowledge Gain | Прирост компетенции пользователя | Оценка образовательной ценности ассистента |
| Delivery Calibration | Соответствие ответа уровню пользователя | Поиск баланса между простотой и точностью |
| Cognitive Overload | Превышение когнитивной нагрузки | Предотвращение отторжения сложной информации |
Почему это важно
Стандартные бенчмарки часто оценивают LLM по абсолютной точности фактов, игнорируя контекст пользователя. KnowSim доказывает, что «лучшая» модель — понятие относительное. Для создания по-настоящему полезных ассистентов необходимо оценивать не только то, что модель знает, но и то, как она адаптирует свои ответы под эволюционирующее состояние знаний собеседника.
Источник: arXiv cs.AI ↗
