Исследования31 августа 2026 г., 12:18 МСК🤖 Auto

Тест на контекст: LLM игнорируют «несущие» данные в лингвистических олимпиадах

Исследование из arXiv показывает, что передовые LLM часто игнорируют инструкции воздержаться от ответа, продолжая галлюцинировать даже при удалении критически важной информации из контекста.

Баннер новости 6406

Проблема: знание или контекст?

Определить, опирается ли большая языковая модель (LLM) на предоставленный контекст или использует внутренние предобученные знания, остается фундаментальной проблемой. Авторы исследования Нех Маджмудар и Елена Филатова предлагают новый диагностический фреймворк, использующий самодостаточные лингвистические олимпиадные задачи. В таких задачах все ответы выводятся исключительно из примеров в контексте, без привлечения внешних знаний.

Методология: Question Damage Score

Исследователи использовали 53 задачи из UK Linguistics Olympiad. Для оценки зависимости от контекста они создали два варианта модификации: случайное удаление примера и целевое удаление (inspired by error-correcting codes) — удаление структурно «несущего» примера, который уникально несет необходимую для ответа информацию. Введенный показатель Question Damage Score позволяет классифицировать задачи как «хрупкие» (fragile) или «устойчивые» (robust).

Результаты: LLM не умеют «не знать»

При тестировании трех передовых LLM с инструкцией воздержаться от ответа при недостатке информации, модели показали критическую слабость. Они редко выбирали вариант отказа от ответа, продолжая генерировать ответы, которые оставались верными даже после удаления несущего контекста. Это указывает на то, что модели часто полагаются на меморизацию или внутренние паттерны, а не на логический вывод из предоставленных данных.

Детали эксперимента

Параметр Значение / Описание
Датасет 53 задачи UK Linguistics Olympiad
Типы удаления Uniform random deletion vs. Targeted deletion (несущий контекст)
Метрика Question Damage Score (оценка уязвимости вопроса)
Ключевой вывод Модели игнорируют инструкции abstain (воздержаться) при потере критической информации

Значение для индустрии

Помимо выявления проблемы галлюцинаций, фреймворк открывает возможности для тонкого анализа: каузальных интервенций, анализа stopping-sets, исследований целевого загрязнения данных (targeted contamination) и механистической интерпретируемости. Это важный шаг к пониманию того, как именно модели принимают решения на основе текста.

Источник: arXiv cs.CL ↗