Скрытый фактор в обучении ИИ
В статье, опубликованной 14 апреля 2026 года в arXiv (ID: 2607.16195), авторы Елена Коптева и Виталий Глиняни-Жук описывают новый тип систематической ошибки в процессе обучения моделей с подкреплением на основе человеческих предпочтений (RLHF). Оказывается, парные предпочтения, которые считаются «золотым стандартом» для настройки моделей, могут отражать не объективное качество ответа, а текущее психоэмоциональное состояние аннотатора.
При длительной работе в стрессовых условиях или при высокой когнитивной нагрузке предпочтения аннотаторов смещаются. Это создает так называемое «состояние аннотатора» (rater state), которое становится скрытой переменной, влияющей на обучение.
Механизм искажения: от усталости к предвзятости
В отличие от случайного шума или обычного разногласия мнений, это искажение является структурированным и зависимым от состояния. Если группа аннотаторов работает в схожих тяжелых условиях, их смещенные предпочтения могут быть агрегированы и переданы в модель вознаграждения (reward model), а затем — в политику оптимизации (policy optimization). Таким образом, «усталость» или «стресс» аннотаторов напрямую кодируются в поведение ИИ.
Ключевые метрики и определения
Авторы предлагают фреймворк для аудита этих искажений, вводя новые измеримые концепции. Особое внимание уделяется «уровню выживания эмоциональной аутентичности» (survival level emotional authenticity) — паттерну ответов, который можно измерить через лексические, прагматические, дискурсивные и связанные с безопасностью признаки.
| Концепция | Описание и значение |
|---|---|
| Rater State Shift | Изменение предпочтений аннотатора, вызванное его текущим состоянием (стресс, усталость), а не качеством контента. |
| Rater State Confound | Скрытая переменная, которая искажает связь между ответом ИИ и оценкой человека. |
| Correlated Rater State Bias | Систематическое смещение, возникающее, когда несколько аннотаторов в схожих условиях дают схожие, но искаженные оценки. |
| Survival Level Emotional Authenticity | Измеримый паттерн ответа, анализируемый через лексические и дискурсивные признаки для выявления влияния состояния аннотатора. |
Практическое применение: Аудит-фреймворк
Исследователи вывели пять фальсифицируемых предсказаний и пороговые значения эффекта для первичного аудита. Предложен протокол, который можно применять к публично доступным моделям, настроенным на инструкции (instruction-tuned models). Важно отметить, что авторы не делают выводов об истории обучения конкретных развернутых моделей, а цель работы — изолировать и продемонстрируем существование этого источника структурированной предвзятости.
Это исследование открывает путь к созданию более надежных методов сбора данных для RLHF, где необходимо контролировать не только качество инструкций, но и условия труда аннотаторов, чтобы избежать внедрения «усталости» в интеллект ИИ.
Источник: arXiv cs.AI ↗
