Суть проблемы: идеологический дрейф
Команда исследователей во главе с Ченди Вангом (Chendi Wang) представила новый фреймворк для оценки надежности LLM в политически чувствительных контекстах. Они обнаружили, что галлюцинации (выдуманные факты) в моделях — это не просто шум, а систематический сдвиг в сторону левого идеологического спектра. Это критично для электоральных процессов, где точность информации имеет высокую цену.
Методология и данные
Для анализа использовался датасет QBias, содержащий 21 727 экспертно размеченных статей из американских СМИ левого, центрального и правого толка. Процесс оценки включал:
- Генерацию вопросов по каждой статье.
- Получение ответов от трех open-weight и одной проприетарной модели.
- Обнаружение галлюцинаций на уровне предложений через сравнение с оригиналом.
- Классификацию идеологической окраски выдуманных предложений с помощью дообученного классификатора.
Ключевые метрики и результаты
Хотя частота галлюцинаций сильно варьируется в зависимости от модели и темы, контент этих галлюцинаций демонстрирует устойчивый дрейф. Большинство выдуманных предложений классифицируются как «левые», даже если исходная статья была написана в консервативном ключе.
| Параметр | Наблюдение | Значение |
|---|---|---|
| Объем датасета | Статьи QBias | 21 727 документов |
| Направление дрейфа | Идеологический сдвиг | Преимущественно влево (Left-leaning) |
| Источник искажения | Политическая ориентация | Дрейф наблюдается даже из правых источников |
| Причина (гипотеза) | Уровень неопределенности | Высокая энтропия логитов → переход к «угадыванию» |
Почему это важно
Анализ логитов показал, что галлюцинации возникают в контекстах высокой энтропии (неопределенности). Модель, не имея четкого ответа, склонна «угадывать» на основе паттернов, преобладающих в обучающих данных, что приводит к систематическому смещению. Это требует разработки новых механизмов защиты (safeguards) для AI-систем, работающих с политической информацией, чтобы избежать непреднамеренной пропаганды.
Источник: arXiv cs.AI ↗
