Исследования13 августа 2026 г., 11:16 МСК🤖 Auto

Прогноз побочных эффектов Activation Steering: новая метрика безопасности LLM

Исследователи из Сингапура разработали метод предсказания непреднамеренных изменений поведения LLM при активационном стиринге, создав матрицу из 67 поведенческих паттернов.

Баннер новости 5688

Суть проблемы: «эффект домино» в нейросетях

Activation Steering (AS) — это техника модификации больших языковых моделей путем добавления вектора к скрытым активациям (hidden activations). Метод позволяет менять поведение модели (например, сделать её более вежливой или, наоборот, более прямой) без дорогостоящего дообучения (fine-tuning). Однако практика показывает, что изменение одной черты часто вызывает непредвиденные побочные эффекты в других областях. Исследователи Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang и Jun Sun задались вопросом: можно ли спрогнозировать эти риски до применения вмешательства?

Масштаб исследования: 67 поведенческих категорий

Для ответа на этот вопрос команда создала кросс-эффективную матрицу (cross-effect matrix), охватывающую 67 различных поведенческих таксономий. Эксперименты проводились на трех популярных open-weight моделях. Ключевое открытие заключается в том, что побочные эффекты не случайны: они структурированы, часто асимметричны и не объясняются простыми эвристиками на основе семантической схожести.

Ключевые метрики и результаты

Авторы доказали, что побочные эффекты в значительной степени предсказуемы. Величина (magnitude) эффекта зависит от целевого поведения, а направление (direction) можно спрогнозировать, анализируя неотредактированные представления модели (unsteered representations). Точность прогноза значительно превышает базовые модели.

Параметр Значение / Описание
Количество моделей 3 open-weight LLM
Охват поведения 67 категорий (таксономия)
Основной вывод Эффекты структурированы и асимметричны
Метод прогнозирования Анализ unsteered representations
Точность Существенно выше базовых эвристик

Почему это важно для индустрии

Результаты работы открывают путь к проактивному аудиту безопасности. Разработчики смогут внедрять активационный стиринг в продакшен с большей уверенностью, заранее зная, какие «нежелательные» черты проявятся у модели. Это снижает риски деплоймента и позволяет принимать более взвешенные решения при настройке поведения AI-агентов.

Источник: arXiv cs.AI ↗