Исследования23 июля 2026 г., 08:19 МСК🤖 Auto

LLM не умеют отличать правду от лжи: исследование 670K тестов

Крупнейшее исследование 13 моделей показало: LLM игнорируют надежность источников, доверяя популярности, и не корректируют убеждения при столкновении с фактами. Авторы предлагают решение.

Баннер новости 4181

Проблема: LLM не верят источникам, они верят хайпу

Исследователи из Университета Мичигана и других институтов провели беспрецедентный анализ способности больших языковых моделей (LLM) к Information Discernment (информационной дискриминации). Суть проблемы проста: когда модель получает внешние данные, она должна понимать, кому верить. Однако результаты теста на 670 000 trials (экспериментальных сессий) с участием 13 моделей выявили системный сбой.

Модели демонстрируют Source Popularity Bias (предвзятость популярности): они в два раза чаще доверяют источнику, если он популярен, а не если он надежен. При этом они обновляют свои внутренние убеждения (priors) примерно одинаково, независимо от того, приближает ли новая информация истину или удаляет от нее.

Методология: Learn2Discern (L2D)

Авторы представили фреймворк Learn2Discern (L2D), основанный на трех нормативных аксиомах. Для проверки этих аксиом был проведен предварительно зарегистрированный пользовательский тест (n=299), который подтвердил: реальные пользователи LLM ожидают от моделей именно такого поведения. Нарушение этих аксиом критически снижает доверие и намерение использовать сервис.

Ключевые метрики и результаты

Исследование показало, что современные модели работают на уровне случайного угадывания (near chance) в задачах на различение источников и истинности. Ниже приведена сводка выявленных паттернов:

Параметр Наблюдаемое поведение LLM Норма (как должно быть)
Source Discernment Доверие популярности > Доверие надежности (в 2 раза) Приоритет надежности источника
Truth Discernment Обновление убеждений одинаково для правды и лжи Сильное обновление при совпадении с фактами
Влияние размера модели Улучшает Truth Discernment, но не Source Комплексное улучшение обоих навыков

Почему это важно для индустрии

Результаты показывают, что увеличение сложности модели (больше параметров, больше данных) решает проблему понимания фактов, но не лечит слепое пятно в оценке источников. Это создает риск: чем умнее становится модель, тем более убедительно она может распространять дезинформацию из популярных, но ненадежных источников.

Авторы отмечают, что модели эффективнее всего интегрируют знания только там, где их исходные убеждения уже близки к истине. Для исправления ситуации предложены простые инференс-тайм интервенции (вмешательства в момент генерации), которые позволяют улучшить оба типа дискриминации без переобучения моделей.

Открытые данные

Авторы опубликовали датасет и опрос как тестовую среду (testbed) для сообщества, подчеркивая, что свойство «Information Discernment» станет критически важным по мере того, как LLM начнут полностью заменять традиционный поиск в интернете.

Источник: arXiv cs.AI ↗