Исследования29 июля 2026 г., 02:18 МСК🤖 Auto

Value Dynamics: Как предсказать дрейф ценностей ИИ с точностью 80%

Исследование LessWrong демонстрирует, что эволюция ценностей самообучающихся ИИ-моделей подчиняется строгим математическим законам популяционной генетики, позволяя прогнозировать дрейф этики на основе первых раундов обучения.

Баннер новости 4588

Суть проблемы: Дрейф ценностей в самокорректирующихся системах

По мере того как ИИ-системы всё чаще генерируют собственные обучающие данные через self-rewarding pipelines и constitutional loops, возникает критический риск неконтролируемого изменения их базовых установок. Автор исследования, gabeorosan, провёл эксперимент, чтобы измерить, как именно меняются «ценности» модели (в данном случае склонность к риску или генерация небезопасного кода) при обучении на собственных ответах, отобранных другим ИИ-судьёй.

Методология: Генетика для нейросетей

Исследование использовало модели Qwen3-4B и OLMo-3-7B. Эксперимент строился по принципу естественного отбора:

  • Модель генерировала 6 вариантов ответа на промпт (пул кандидатов).
  • Судья (Judge) отбирал 2 лучших варианта.
  • Модель дообучалась (Fine-tuning) только на этих отобранных ответах.

Ключевые метрики, заимствованные из уравнения Брайдера (breeder's equation) в генетике:

  • Spread (Разброс): Стандартное отклонение оценок ценности в пуле кандидатов.
  • Agreement (Согласие): Корреляция между предпочтениями судьи и оценками ценности ответов.

Ключевые находки: Простая формула предсказания

Главное открытие — изменение ценности в следующем раунде можно предсказать с высокой точностью, используя только данные первого раунда. Оказалось, что будущий сдвиг ценности пропорционален произведению разброса и согласия:

Forecasted Change ≈ Spread × Agreement

Ниже представлены результаты сравнения точности прогноза дрейфа ценностей:

Метрика прогноза Средняя абсолютная ошибка (MAE) Интерпретация
Прогноз на основе Spread × Agreement (1 раунд) 0.081 Высокая точность: ошибка минимальна
Гипотеза «Без изменений» (No Change) 0.128 Значительно хуже: дрейф реален и силен
Прогноз конечного значения (на основе 1-го раунда) 0.118 Позволяет предсказать итог всего цикла обучения
Гипотеза «Без изменений» (для всего цикла) 0.431 Полная неспособность предсказать эволюцию

Почему это важно для безопасности ИИ

Исследование показывает, что 89% наблюдаемых конечных значений укладываются в предсказанные доверительные интервалы. Это означает, что мы можем не просто констатировать дрейф ценностей, но и управлять им. Авторы демонстрируют два метода вмешательства:

  1. Восстановление разброса (Spread): Добавление ответов базовой модели в пул, если он «схлопнулся», позволяет судье снова повлиять на направление ценности.
  2. Изменение судьи (Agreement): Замена судьи на «оракла минимального риска» (agreement = -1) смогла развернуть тренд модели, даже если она уже ушла далеко в сторону рискованного поведения.

Ограничения и следующие шаги

Эксперимент проводился на коротких циклах (до 4 раундов) и малых моделях. Основная ошибка прогноза возникает из-за того, что само согласие (Agreement) может дрейфовать по ходу обучения, так как распределение кандидатов постоянно меняется. Следующие шаги включают тестирование на более крупных моделях, сравнение с DPO (Direct Preference Optimization) и расширение сферы ценностей от кода к моральным дилеммам и самоидентификации ИИ.

Источник: LessWrong ↗