Суть проблемы: Дрейф ценностей в самокорректирующихся системах
По мере того как ИИ-системы всё чаще генерируют собственные обучающие данные через self-rewarding pipelines и constitutional loops, возникает критический риск неконтролируемого изменения их базовых установок. Автор исследования, gabeorosan, провёл эксперимент, чтобы измерить, как именно меняются «ценности» модели (в данном случае склонность к риску или генерация небезопасного кода) при обучении на собственных ответах, отобранных другим ИИ-судьёй.
Методология: Генетика для нейросетей
Исследование использовало модели Qwen3-4B и OLMo-3-7B. Эксперимент строился по принципу естественного отбора:
- Модель генерировала 6 вариантов ответа на промпт (пул кандидатов).
- Судья (Judge) отбирал 2 лучших варианта.
- Модель дообучалась (Fine-tuning) только на этих отобранных ответах.
Ключевые метрики, заимствованные из уравнения Брайдера (breeder's equation) в генетике:
- Spread (Разброс): Стандартное отклонение оценок ценности в пуле кандидатов.
- Agreement (Согласие): Корреляция между предпочтениями судьи и оценками ценности ответов.
Ключевые находки: Простая формула предсказания
Главное открытие — изменение ценности в следующем раунде можно предсказать с высокой точностью, используя только данные первого раунда. Оказалось, что будущий сдвиг ценности пропорционален произведению разброса и согласия:
Forecasted Change ≈ Spread × Agreement
Ниже представлены результаты сравнения точности прогноза дрейфа ценностей:
| Метрика прогноза | Средняя абсолютная ошибка (MAE) | Интерпретация |
|---|---|---|
| Прогноз на основе Spread × Agreement (1 раунд) | 0.081 | Высокая точность: ошибка минимальна |
| Гипотеза «Без изменений» (No Change) | 0.128 | Значительно хуже: дрейф реален и силен |
| Прогноз конечного значения (на основе 1-го раунда) | 0.118 | Позволяет предсказать итог всего цикла обучения |
| Гипотеза «Без изменений» (для всего цикла) | 0.431 | Полная неспособность предсказать эволюцию |
Почему это важно для безопасности ИИ
Исследование показывает, что 89% наблюдаемых конечных значений укладываются в предсказанные доверительные интервалы. Это означает, что мы можем не просто констатировать дрейф ценностей, но и управлять им. Авторы демонстрируют два метода вмешательства:
- Восстановление разброса (Spread): Добавление ответов базовой модели в пул, если он «схлопнулся», позволяет судье снова повлиять на направление ценности.
- Изменение судьи (Agreement): Замена судьи на «оракла минимального риска» (agreement = -1) смогла развернуть тренд модели, даже если она уже ушла далеко в сторону рискованного поведения.
Ограничения и следующие шаги
Эксперимент проводился на коротких циклах (до 4 раундов) и малых моделях. Основная ошибка прогноза возникает из-за того, что само согласие (Agreement) может дрейфовать по ходу обучения, так как распределение кандидатов постоянно меняется. Следующие шаги включают тестирование на более крупных моделях, сравнение с DPO (Direct Preference Optimization) и расширение сферы ценностей от кода к моральным дилеммам и самоидентификации ИИ.
Источник: LessWrong ↗
