Исследования25 июля 2026 г., 05:17 МСК🤖 Auto

SONI: Как шум заставляет нейросети «выпрямлять» опасные концепции

Исследователь Jasper Chong представил метод SONI, который с помощью направленного шума делает конкретные признаки в нейросети ортогональными, не ломая архитектуру и не требуя сложных функций потерь.

Баннер новости 4350

Проблема суперпозиции и «грязных» признаков

Нейросети используют явление суперпозиции: они упаковывают больше концепций, чем есть измерений в латентном пространстве, делая векторы признаков «почти ортогональными». Это создает критическую проблему для безопасности AI: если концепция «обмана» или «создания биологического оружия» переплетена с обычными признаками, попытки изолировать или удалить опасную концепцию (concept erasure) приводят к непредсказуемым побочным эффектам.

Существующие решения имеют недостатки:

  • Штрафы за разреженность (Sparsity penalties): Делают все признаки полностью ортогональными, но уничтожают емкость модели и резко снижают качество.
  • Разреженные автоэнкодеры (SAE): Позволяют «смотреть» на признаки в более чистом виде, но не меняют геометрию самой модели. Это лишь пост-хок инструмент, а не исправление архитектуры.

Решение: SONI (Selective Orthogonalisation via Noise Injection)

Авторы предлагают метод тонкой настройки (fine-tuning), который использует направленный шум для изоляции конкретного целевого признака. Ключевые особенности:

  1. Без изменения функции потерь: Метод не требует модификации архитектуры или добавления сложных штрафов в loss function.
  2. Направленный шум: Шум добавляется только в направлении целевого вектора. Это создает «чисто вращательное усилие» (purely rotational force) при обратном распространении ошибки, отталкивая другие признаки от целевого, а не просто масштабируя их.
  3. Выборочность: Ортогонализация применяется только к выбранным направлениям, сохраняя плотность представлений в остальной части пространства.

Механика: Функция шума

Метод использует кусочно-линейную функцию, которая определяет количество шума на основе косинусного сходства между целевым вектором и другими признаками. Шум максимизируется для векторов, выровненных или анти-выровненных с целью, и равен нулю для уже ортогональных.

Состояние признака относительно цели Косинусное сходство Действие шума Цель
Идеально ортогонален 0 Нет шума (0) Сохранить текущее состояние
Выровнен (совпадает) 1 Максимальный шум Оттолкнуть, чтобы избежать дублирования
Анти-выровнен (антподальная пара) -1 Максимальный шум Разорвать связь, так как это мешает интерпретируемости
Частично коррелирован 0 < |cos| < 1 Линейный градиент Плавное вращение в пространстве

Результаты на Toy Models of Superposition (TMS)

Метод протестирован на моделях Anthropic TMS. Результаты показывают, что SONI значительно увеличивает ортогональность всех остальных признаков относительно целевого в различных размерностях. В разреженных режимах (sparse regimes) метод дает геометрическую гарантию разделения, что может сделать последующие вмешательства в безопасность (safety interventions) значительно более надежными.

Ограничение метода на данный момент — высокая частота сбоев при совместной активации (co-activation failure) при низких уровнях разреженности, однако в условиях высокой разреженности подход работает стабильно.

Почему это важно?

SONI предлагает «золотую середину» между полной ортогонализацией (которая убивает модель) и пассивным наблюдением (SAE). Если метод будет успешно масштабирован на большие языковые модели (LLM), он позволит инженерам по безопасности «вырезать» опасные концепции из латентного пространства, не разрушая общие способности модели к генерации текста.

Источник: LessWrong ↗