Суть эксперимента: обратный инжиниринг представлений
В рамках технического челленджа BlueDot исследователь Phu Hoang решил задачу, обратную типичному подходу к интерпретируемости. Вместо того чтобы искать скрытые паттерны в уже обученной модели, он задал геометрию заранее и заставил нейросеть использовать именно её для кодирования семантического признака «страна» (country). Цель — проверить, можно ли зафиксировать форму представления (манifold) до обучения, сохранив при этом способность модели решать исходную задачу.
Использовалась архитектура из 5 слоев с функцией активации ReLU. Входные данные (предложения) кодировались моделью sentence-transformers/all-MiniLM-L6-v2 и усреднялись. Ключевое ограничение: для кодирования признака «страна» выделялись всего 3 канала (pre-activations) в скрытом слое hidden2, тогда как остальные 61 канал оставались для других задач.
Выбор геометрии: Сфера vs Спираль
Автор выбрал два типа трехмерных многообразий, где классы (присутствие страны / отсутствие) различаются не направлением, а расстоянием до структуры:
- Сферическая оболочка (Sphere Shell): Положительные примеры располагаются на внутренней сфере (радиус ~0.5), отрицательные — на внешней (радиус ~1.0). Направление вектора случайно, важна только длина.
- Трубка спирали (Helix Tube): Оба класса распределены вдоль одной и той же спиральной кривой. Положительные примеры ближе к оси спирали, отрицательные — дальше. Это создает нелинейную, изогнутую структуру представления.
Результаты: Точность и «причинность»
Модель смогла сохранить высокую точность классификации (AUC > 0.99) даже с жесткими геометрическими ограничениями. Однако ключевой метрикой стала проверка того, действительно ли «хвост» модели (tail layer) использует эту геометрию для принятия решений, а не просто игнорирует её.
| Геометрия | Mean Task AUC (↑) | Country AUC (↑) | Geometry Probe AUC (↑) | Linear Probe AUC (↓) | Coverage Entropy (↑) | Causal Delta (↑) |
|---|---|---|---|---|---|---|
| Sphere shell | 0.9975 | 0.9995 | 0.2021 | 0.9996 | 0.7971 | 0.0187 |
| Helix tube | 0.9963 | 0.9997 | 0.1182 | — | — | — |
Важные выводы из таблицы:
- Linear Probe AUC: Значение 0.9996 для сферы означает, что признак «страна» остался легко линейно разделимым в полном пространстве, несмотря на попытки спрятать его в нелинейную геометрию. Это указывает на то, что модель использует «короткие пути» (shortcuts) параллельно с заданной геометрией.
- Causal Delta: Положительное значение (0.0187 для сферы) подтверждает, что вмешательство в каналы геометрии действительно меняет прогноз модели. То есть, модель слушает эту структуру, даже если она не является единственным источником информации.
- Geometry Probe AUC: Низкие значения (0.20 и 0.11) говорят о том, что простой линейный зонд не может легко прочитать класс из чистой геометрии, что подтверждает нелинейность и сложность кодирования.
Почему это важно для AI Safety
Эксперимент демонстрирует возможность manifold steering в обратном направлении. Если мы можем заставить модель использовать предсказуемую, контролируемую геометрическую форму для хранения семантических признаков, это открывает путь к более надежному контролю над внутренними представлениями ИИ. Однако результат с высоким Linear Probe AUC служит предупреждением: даже при наличии сложной нелинейной структуры, модель может сохранять простые линейные «запасные» пути, что требует дополнительных мер по их устранению для истинной интерпретируемости.
Источник: LessWrong ↗
