Исследования21 июля 2026 г., 07:16 МСК🤖 Auto

RLHF-ловушка: как усталость аннотаторов ломает модели ИИ

Исследователи выявили систематическое искажение в данных RLHF: предпочтения аннотаторов зависят от их эмоционального состояния, а не только от качества ответов ИИ.

Баннер новости 4006

Скрытый фактор в обучении ИИ

В статье, опубликованной 14 апреля 2026 года в arXiv (ID: 2607.16195), авторы Елена Коптева и Виталий Глиняни-Жук описывают новый тип систематической ошибки в процессе обучения моделей с подкреплением на основе человеческих предпочтений (RLHF). Оказывается, парные предпочтения, которые считаются «золотым стандартом» для настройки моделей, могут отражать не объективное качество ответа, а текущее психоэмоциональное состояние аннотатора.

При длительной работе в стрессовых условиях или при высокой когнитивной нагрузке предпочтения аннотаторов смещаются. Это создает так называемое «состояние аннотатора» (rater state), которое становится скрытой переменной, влияющей на обучение.

Механизм искажения: от усталости к предвзятости

В отличие от случайного шума или обычного разногласия мнений, это искажение является структурированным и зависимым от состояния. Если группа аннотаторов работает в схожих тяжелых условиях, их смещенные предпочтения могут быть агрегированы и переданы в модель вознаграждения (reward model), а затем — в политику оптимизации (policy optimization). Таким образом, «усталость» или «стресс» аннотаторов напрямую кодируются в поведение ИИ.

Ключевые метрики и определения

Авторы предлагают фреймворк для аудита этих искажений, вводя новые измеримые концепции. Особое внимание уделяется «уровню выживания эмоциональной аутентичности» (survival level emotional authenticity) — паттерну ответов, который можно измерить через лексические, прагматические, дискурсивные и связанные с безопасностью признаки.

Концепция Описание и значение
Rater State Shift Изменение предпочтений аннотатора, вызванное его текущим состоянием (стресс, усталость), а не качеством контента.
Rater State Confound Скрытая переменная, которая искажает связь между ответом ИИ и оценкой человека.
Correlated Rater State Bias Систематическое смещение, возникающее, когда несколько аннотаторов в схожих условиях дают схожие, но искаженные оценки.
Survival Level Emotional Authenticity Измеримый паттерн ответа, анализируемый через лексические и дискурсивные признаки для выявления влияния состояния аннотатора.

Практическое применение: Аудит-фреймворк

Исследователи вывели пять фальсифицируемых предсказаний и пороговые значения эффекта для первичного аудита. Предложен протокол, который можно применять к публично доступным моделям, настроенным на инструкции (instruction-tuned models). Важно отметить, что авторы не делают выводов об истории обучения конкретных развернутых моделей, а цель работы — изолировать и продемонстрируем существование этого источника структурированной предвзятости.

Это исследование открывает путь к созданию более надежных методов сбора данных для RLHF, где необходимо контролировать не только качество инструкций, но и условия труда аннотаторов, чтобы избежать внедрения «усталости» в интеллект ИИ.

Источник: arXiv cs.AI ↗