Исследования8 августа 2026 г., 04:18 МСК🤖 Auto

LLM-предвзятость: как предвзятые промпты меняют ответы моделей

Исследование 8 топовых LLM показало, что предвзятые реплики пользователя систематически усиливают когнитивные искажения в ответах, хотя явные маркеры могут запускать механизмы защиты.

Баннер новости 5351

Суть исследования

Команда исследователей во главе с Сачини Вирасеккарой провела масштабную оценку выражения когнитивных предубеждений в современных instruction-tuned LLM. В отличие от предыдущих работ, фокусировавшихся на статичных запросах, этот эксперимент моделировал реалистичные многооборотные диалоги. Авторы ввели новую трехусловную экспериментальную рамку, которая позволяет отделить эффект воздействия предвзятой реплики пользователя от самого семантического содержания запроса.

Масштаб данных и методология

Для тестирования был создан бенчмарк, состоящий из 24 300 пользовательских промптов, прошедших валидацию жюри. Эти промпты покрывают все 81 ячейки матрицы взаимодействия «целевая-человеческая предвзятость» (9x9 target-human bias interaction matrix). Исследование охватило восемь передовых языковых моделей, сравнивая их поведение в условиях «с нуля» (zero-shot) с многооборотными сценариями, содержащими предвзятые контексты.

Ключевые результаты

Результаты выявили систематический сдвиг: в 6 из 8 протестированных моделей наличие предвзятого контекста диалога приводило к увеличению выражения предвзятости по сравнению с базовыми показателями. Однако авторы идентифицировали два конкурирующих поведенческих динамика, которые объясняют природу этого эффекта:

  • Эффект экспозиции: Само по себе знакомство с предвзятым рассуждением в предыдущих репликах усиливает склонность модели к аналогичным выводам в дальнейшем.
  • Эффект подавления: Явные маркеры предвзятости (explicit bias cues) часто запускают механизмы, связанные с выравниванием (alignment), что приводит к снижению явного выражения предвзятости.

Значение для индустрии

Работа демонстрирует, что безопасность и объективность LLM не являются статичными свойствами. Они сильно зависят от контекста взаимодействия. Исследователи опубликовали свой фреймворк, код и набор данных, чтобы помочь сообществу лучше понимать условные когнитивные искажения и поведение адаптации в LLM.

Источник: arXiv cs.CL ↗