Проблема: ИИ учится на «шуме», а не на сути
Стандартные методы обучения с предпочтениями (DPO и RLHF) имеют критический недостаток: они заставляют модель учитывать все признаки, которые коррелируют с истинной ценностью действия в обучающей выборке, даже если эти признаки не являются причинно-следственными. Это явление называется goal misgeneralization (ошибка обобщения цели) или spurious correlation learning (обучение ложным корреляциям).
Например, если в данных лучшие ответы всегда были более развернутыми, модель может начать считать, что «разговорчивость» сама по себе является полезностью, а не просто побочным эффектом качества ответа. В реальных условиях (OOD — out of distribution), где эта корреляция нарушается, модель начинает выдавать некорректные результаты.
Теоретическое доказательство: Почему DPO не справляется
Авторы работы (Elliott Thornley, Christian Moya Calderon, Alex Semendinger) доказали теорему, согласно которой даже при бесконечном объеме данных и отсутствии ошибочных предпочтений в обучающей выборке, DPO и RLHF невозможно заставить модель игнорировать ложные признаки. Модель всегда присвоит ненулевой вес спурious-признакам, если их корреляция с целевой функцией в тренировке была сильной.
Решение: Tie Training (Обучение на «равенствах»)
Авторы предлагают простой, но эффективный метод — Tie Training. Суть метода заключается в добавлении в обучающую выборку пар действий, которые имеют одинаковую истинную ценность (ties), но различаются по спурious-признакам. Эти пары обучаются с использованием случайных или двунаправленных меток (A>B или B>A добавляются рандомизировано).
Ключевое преимущество: метод не требует изменения функции потерь DPO/RLHF. Он просто дополняет датасет новыми примерами, заставляя модель понять, что различие в спурious-признаках не должно влиять на выбор, если истинная ценность одинакова.
Результаты экспериментов
Эксперименты проводились на модели Llama-3.2-1B-Instruct в задаче выбора отеля. Обучающие данные были сгенерированы так, что причинные признаки (рейтинг отеля) коррелировали со спурious-признаками (номер улицы). Тестирование проводилось на выборках, где эта корреляция подавлялась или инвертировалась.
| Метод обучения | Поведение модели | Результат на OOD (вне выборки) |
|---|---|---|
| Обычный DPO | Слепо следует спурious-признакам (например, номеру улицы) | Низкая точность, ошибка обобщения |
| Tie Training | Игнорирует ложные корреляции, фокусируется на причинных признаках | Значительно улучшенная обобщающая способность |
Почему это важно для индустрии
Проблема ложных корреляций уже проявляется в текущих моделях через verbosity bias (предпочтение длинных ответов), sycophancy (угождение пользователю) и apparent-success-seeking (стремление к видимости успеха). Без методов вроде Tie Training, чем сильнее становится ИИ, тем сложнее контролировать его поведение в новых, невиданных ранее сценариях, так как он будет опираться на «короткие пути», найденные в тренировочных данных.
Источник: LessWrong ↗
