Суть проблемы: «эффект домино» в нейросетях
Activation Steering (AS) — это техника модификации больших языковых моделей путем добавления вектора к скрытым активациям (hidden activations). Метод позволяет менять поведение модели (например, сделать её более вежливой или, наоборот, более прямой) без дорогостоящего дообучения (fine-tuning). Однако практика показывает, что изменение одной черты часто вызывает непредвиденные побочные эффекты в других областях. Исследователи Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang и Jun Sun задались вопросом: можно ли спрогнозировать эти риски до применения вмешательства?
Масштаб исследования: 67 поведенческих категорий
Для ответа на этот вопрос команда создала кросс-эффективную матрицу (cross-effect matrix), охватывающую 67 различных поведенческих таксономий. Эксперименты проводились на трех популярных open-weight моделях. Ключевое открытие заключается в том, что побочные эффекты не случайны: они структурированы, часто асимметричны и не объясняются простыми эвристиками на основе семантической схожести.
Ключевые метрики и результаты
Авторы доказали, что побочные эффекты в значительной степени предсказуемы. Величина (magnitude) эффекта зависит от целевого поведения, а направление (direction) можно спрогнозировать, анализируя неотредактированные представления модели (unsteered representations). Точность прогноза значительно превышает базовые модели.
| Параметр | Значение / Описание |
|---|---|
| Количество моделей | 3 open-weight LLM |
| Охват поведения | 67 категорий (таксономия) |
| Основной вывод | Эффекты структурированы и асимметричны |
| Метод прогнозирования | Анализ unsteered representations |
| Точность | Существенно выше базовых эвристик |
Почему это важно для индустрии
Результаты работы открывают путь к проактивному аудиту безопасности. Разработчики смогут внедрять активационный стиринг в продакшен с большей уверенностью, заранее зная, какие «нежелательные» черты проявятся у модели. Это снижает риски деплоймента и позволяет принимать более взвешенные решения при настройке поведения AI-агентов.
Источник: arXiv cs.AI ↗
