Исследования24 июля 2026 г., 17:18 МСК🤖 Auto

Наклон влево: LLM систематически искажают новости в сторону либерализма

Исследование arXiv выявило «направленные галлюцинации» в LLM: при ответе на вопросы по политическим новостям модели массово добавляют левые идеологемы, даже если источник был правым.

Баннер новости 4306

Суть проблемы: идеологический дрейф

Команда исследователей во главе с Ченди Вангом (Chendi Wang) представила новый фреймворк для оценки надежности LLM в политически чувствительных контекстах. Они обнаружили, что галлюцинации (выдуманные факты) в моделях — это не просто шум, а систематический сдвиг в сторону левого идеологического спектра. Это критично для электоральных процессов, где точность информации имеет высокую цену.

Методология и данные

Для анализа использовался датасет QBias, содержащий 21 727 экспертно размеченных статей из американских СМИ левого, центрального и правого толка. Процесс оценки включал:

  • Генерацию вопросов по каждой статье.
  • Получение ответов от трех open-weight и одной проприетарной модели.
  • Обнаружение галлюцинаций на уровне предложений через сравнение с оригиналом.
  • Классификацию идеологической окраски выдуманных предложений с помощью дообученного классификатора.

Ключевые метрики и результаты

Хотя частота галлюцинаций сильно варьируется в зависимости от модели и темы, контент этих галлюцинаций демонстрирует устойчивый дрейф. Большинство выдуманных предложений классифицируются как «левые», даже если исходная статья была написана в консервативном ключе.

Параметр Наблюдение Значение
Объем датасета Статьи QBias 21 727 документов
Направление дрейфа Идеологический сдвиг Преимущественно влево (Left-leaning)
Источник искажения Политическая ориентация Дрейф наблюдается даже из правых источников
Причина (гипотеза) Уровень неопределенности Высокая энтропия логитов → переход к «угадыванию»

Почему это важно

Анализ логитов показал, что галлюцинации возникают в контекстах высокой энтропии (неопределенности). Модель, не имея четкого ответа, склонна «угадывать» на основе паттернов, преобладающих в обучающих данных, что приводит к систематическому смещению. Это требует разработки новых механизмов защиты (safeguards) для AI-систем, работающих с политической информацией, чтобы избежать непреднамеренной пропаганды.

Источник: arXiv cs.AI ↗