Проблема суперпозиции и «грязных» признаков
Нейросети используют явление суперпозиции: они упаковывают больше концепций, чем есть измерений в латентном пространстве, делая векторы признаков «почти ортогональными». Это создает критическую проблему для безопасности AI: если концепция «обмана» или «создания биологического оружия» переплетена с обычными признаками, попытки изолировать или удалить опасную концепцию (concept erasure) приводят к непредсказуемым побочным эффектам.
Существующие решения имеют недостатки:
- Штрафы за разреженность (Sparsity penalties): Делают все признаки полностью ортогональными, но уничтожают емкость модели и резко снижают качество.
- Разреженные автоэнкодеры (SAE): Позволяют «смотреть» на признаки в более чистом виде, но не меняют геометрию самой модели. Это лишь пост-хок инструмент, а не исправление архитектуры.
Решение: SONI (Selective Orthogonalisation via Noise Injection)
Авторы предлагают метод тонкой настройки (fine-tuning), который использует направленный шум для изоляции конкретного целевого признака. Ключевые особенности:
- Без изменения функции потерь: Метод не требует модификации архитектуры или добавления сложных штрафов в loss function.
- Направленный шум: Шум добавляется только в направлении целевого вектора. Это создает «чисто вращательное усилие» (purely rotational force) при обратном распространении ошибки, отталкивая другие признаки от целевого, а не просто масштабируя их.
- Выборочность: Ортогонализация применяется только к выбранным направлениям, сохраняя плотность представлений в остальной части пространства.
Механика: Функция шума
Метод использует кусочно-линейную функцию, которая определяет количество шума на основе косинусного сходства между целевым вектором и другими признаками. Шум максимизируется для векторов, выровненных или анти-выровненных с целью, и равен нулю для уже ортогональных.
| Состояние признака относительно цели | Косинусное сходство | Действие шума | Цель |
|---|---|---|---|
| Идеально ортогонален | 0 | Нет шума (0) | Сохранить текущее состояние |
| Выровнен (совпадает) | 1 | Максимальный шум | Оттолкнуть, чтобы избежать дублирования |
| Анти-выровнен (антподальная пара) | -1 | Максимальный шум | Разорвать связь, так как это мешает интерпретируемости |
| Частично коррелирован | 0 < |cos| < 1 | Линейный градиент | Плавное вращение в пространстве |
Результаты на Toy Models of Superposition (TMS)
Метод протестирован на моделях Anthropic TMS. Результаты показывают, что SONI значительно увеличивает ортогональность всех остальных признаков относительно целевого в различных размерностях. В разреженных режимах (sparse regimes) метод дает геометрическую гарантию разделения, что может сделать последующие вмешательства в безопасность (safety interventions) значительно более надежными.
Ограничение метода на данный момент — высокая частота сбоев при совместной активации (co-activation failure) при низких уровнях разреженности, однако в условиях высокой разреженности подход работает стабильно.
Почему это важно?
SONI предлагает «золотую середину» между полной ортогонализацией (которая убивает модель) и пассивным наблюдением (SAE). Если метод будет успешно масштабирован на большие языковые модели (LLM), он позволит инженерам по безопасности «вырезать» опасные концепции из латентного пространства, не разрушая общие способности модели к генерации текста.
Источник: LessWrong ↗
