Кризис парадигмы RLHF
Стандартный подход к выравниванию ИИ (alignment), основанный на локальных попарных сравнениях, опирается на два спорных допущения: что локальных примеров достаточно для понимания глобальных правил, и что человек всегда может дать четкий ответ. Авторы статьи «Internal Pluralism and the Limits of Pairwise Comparisons» (arXiv:2607.02672) показывают, что эти допущения рушатся под давлением внутреннего плюрализма — состояния, когда человек оценивает решения через призму нескольких конфликтующих авторитетных приоритетов.
Два типа сбоев при принуждении к выбору
Исследователи выделяют две фундаментальные проблемы, возникающие при попытке «выучить» предпочтения через попарные сравнения:
- Глобальная природа приоритетов: Такие ценности, как пропорциональность, эгалитаризм и равное отношение, не являются локальными. Решение, которое кажется оптимальным в одном случае, может нарушить принцип справедливости в другом. Локальные сравнения не способны зафиксировать эти глобальные связи.
- Внутренний конфликт: Даже если приоритеты можно описать локально, сильное напряжение между ними порождает когнитивный диссонанс. Принуждение человека к выбору в такой ситуации приводит к поведенческим искажениям, которые модель воспринимает как истинные предпочтения, хотя они являются лишь следствием стресса от выбора.
Решение: легализация нерешительности
Ключевой вывод работы заключается в том, что разрешение пользователям сообщать о нерешительности (indecision) значительно повышает точность обучения. Модель показала, что такой подход позволяет сократить количество необходимых запросов (queries) к человеку, так как система перестает интерпретировать колебания как сигнал о предпочтении одного варианта другому.
Перспективы: от сравнений к приоритетам
Авторы предлагают перейти от сбора данных о сравнениях к методам, которые извлекают сами приоритеты напрямую. Это позволит создавать более интерпретируемые и честные модели, которые понимают не просто «что выбрать», а «почему это важно».
| Аспект | Стандартный подход (Попарные сравнения) | Предлагаемая модель (Внутренний плюрализм) |
|---|---|---|
| Базовая единица | Локальное сравнение двух вариантов | Глобальные приоритеты (справедливость, пропорциональность) |
| Отношение к конфликту | Игнорируется; человек обязан выбрать | Признается источником искажений; разрешена нерешительность |
| Точность данных | Низкая из-за поведенческих искажений | Выше за счет снижения когнитивной нагрузки |
| Цель обучения | Предсказать выбор | Выявить underlying ценности (priorities) |
Источник: arXiv cs.AI ↗
