Проблема: знание или контекст?
Определить, опирается ли большая языковая модель (LLM) на предоставленный контекст или использует внутренние предобученные знания, остается фундаментальной проблемой. Авторы исследования Нех Маджмудар и Елена Филатова предлагают новый диагностический фреймворк, использующий самодостаточные лингвистические олимпиадные задачи. В таких задачах все ответы выводятся исключительно из примеров в контексте, без привлечения внешних знаний.
Методология: Question Damage Score
Исследователи использовали 53 задачи из UK Linguistics Olympiad. Для оценки зависимости от контекста они создали два варианта модификации: случайное удаление примера и целевое удаление (inspired by error-correcting codes) — удаление структурно «несущего» примера, который уникально несет необходимую для ответа информацию. Введенный показатель Question Damage Score позволяет классифицировать задачи как «хрупкие» (fragile) или «устойчивые» (robust).
Результаты: LLM не умеют «не знать»
При тестировании трех передовых LLM с инструкцией воздержаться от ответа при недостатке информации, модели показали критическую слабость. Они редко выбирали вариант отказа от ответа, продолжая генерировать ответы, которые оставались верными даже после удаления несущего контекста. Это указывает на то, что модели часто полагаются на меморизацию или внутренние паттерны, а не на логический вывод из предоставленных данных.
Детали эксперимента
| Параметр | Значение / Описание |
|---|---|
| Датасет | 53 задачи UK Linguistics Olympiad |
| Типы удаления | Uniform random deletion vs. Targeted deletion (несущий контекст) |
| Метрика | Question Damage Score (оценка уязвимости вопроса) |
| Ключевой вывод | Модели игнорируют инструкции abstain (воздержаться) при потере критической информации |
Значение для индустрии
Помимо выявления проблемы галлюцинаций, фреймворк открывает возможности для тонкого анализа: каузальных интервенций, анализа stopping-sets, исследований целевого загрязнения данных (targeted contamination) и механистической интерпретируемости. Это важный шаг к пониманию того, как именно модели принимают решения на основе текста.
Источник: arXiv cs.CL ↗
