Исследования7 июля 2026 г., 07:17 МСК🤖 Auto

Внутренний плюрализм: почему попарные сравнения ломают обучение предпочтений

Исследование Bailey Flanigan и Michelle Si доказывает, что стандартный метод обучения через попарные сравнения (RLHF) не способен уловить глобальные этические приоритеты и вызывает когнитивные искажения у людей.

Баннер новости 3004

Кризис парадигмы RLHF

Стандартный подход к выравниванию ИИ (alignment), основанный на локальных попарных сравнениях, опирается на два спорных допущения: что локальных примеров достаточно для понимания глобальных правил, и что человек всегда может дать четкий ответ. Авторы статьи «Internal Pluralism and the Limits of Pairwise Comparisons» (arXiv:2607.02672) показывают, что эти допущения рушатся под давлением внутреннего плюрализма — состояния, когда человек оценивает решения через призму нескольких конфликтующих авторитетных приоритетов.

Два типа сбоев при принуждении к выбору

Исследователи выделяют две фундаментальные проблемы, возникающие при попытке «выучить» предпочтения через попарные сравнения:

  • Глобальная природа приоритетов: Такие ценности, как пропорциональность, эгалитаризм и равное отношение, не являются локальными. Решение, которое кажется оптимальным в одном случае, может нарушить принцип справедливости в другом. Локальные сравнения не способны зафиксировать эти глобальные связи.
  • Внутренний конфликт: Даже если приоритеты можно описать локально, сильное напряжение между ними порождает когнитивный диссонанс. Принуждение человека к выбору в такой ситуации приводит к поведенческим искажениям, которые модель воспринимает как истинные предпочтения, хотя они являются лишь следствием стресса от выбора.

Решение: легализация нерешительности

Ключевой вывод работы заключается в том, что разрешение пользователям сообщать о нерешительности (indecision) значительно повышает точность обучения. Модель показала, что такой подход позволяет сократить количество необходимых запросов (queries) к человеку, так как система перестает интерпретировать колебания как сигнал о предпочтении одного варианта другому.

Перспективы: от сравнений к приоритетам

Авторы предлагают перейти от сбора данных о сравнениях к методам, которые извлекают сами приоритеты напрямую. Это позволит создавать более интерпретируемые и честные модели, которые понимают не просто «что выбрать», а «почему это важно».

Аспект Стандартный подход (Попарные сравнения) Предлагаемая модель (Внутренний плюрализм)
Базовая единица Локальное сравнение двух вариантов Глобальные приоритеты (справедливость, пропорциональность)
Отношение к конфликту Игнорируется; человек обязан выбрать Признается источником искажений; разрешена нерешительность
Точность данных Низкая из-за поведенческих искажений Выше за счет снижения когнитивной нагрузки
Цель обучения Предсказать выбор Выявить underlying ценности (priorities)

Источник: arXiv cs.AI ↗