Суть головоломки и скрытая нелинейность
Задача BlueDot TAIS #1 заключалась в анализе пятислойного MLP поверх замороженных эмбеддингов MiniLM. Модель предсказывала восемь бинарных признаков. Семь из них линейно восстанавливались на слое h2, но один — country — терял свою линейную структуру. Точность линейного зонда для country падала до 0.43 (уровень случайности), хотя нелинейный зонд восстанавливал её до 0.96.
Причина крылась в XOR-логике: положительные примеры country=1 были «зажаты» внутри отрицательных country=0 вдоль одной оси. Это создавало вложенную геометрию, где классы имели общий средний вектор, делая их неразличимыми для гиперплоскости.
Доказательство причинности через DAS
Авторы использовали Distributed Alignment Search (DAS) для изоляции одномерного нелинейного подпространства на слое h2. Ключевым доказательством стало применение activation patching: изменение единственной координаты в этом подпространстве напрямую влияло на выходные данные модели. Это доказало, что скрытая геометрия не является артефактом, а активно участвует в вычислениях.
Решение: Velocity Ring (Кольцо скорости)
Для третьего задания требовалось создать еще более «странный» тип представления. Левонян разработала Velocity Ring — непрерывную геометрию с нулевым средним, которая хранится не в состоянии слоя, а в скорости (разнице между слоями: v = h3 - h2).
Механизм работает так:
- Выделено 2D-подпространство в обновлении между слоями.
- Положительные примеры размещаются на окружности радиуса ~0.87, отрицательные — в начале координат.
- Угол на окружности независим от других меток, а радиус кодирует признак.
Поскольку среднее значение кольца равно нулю, линейные зонды и PCA не могут разделить классы (точность ~0.32). Однако нелинейный классификатор, читающий радиус, достигает точности >90% на выходе.
Почему это важно для интерпретируемости
Эксперименты показали, что попытка разместить такое кольцо непосредственно в состоянии слоя (h2) приводит к появлению «линейной тени» — остаточных корреляций, которые замечают стандартные зонды. Velocity Ring избегает этого, так как использует зарезервированное подпространство в обновлении, к которому не имеют доступа другие признаки (благодаря маскировке в l5). Это создает «слепую зону» для линейных методов анализа, оставаясь при этом функциональной частью вычислительного графа.
| Метрика / Метод | Стандартный слой (h2) | Velocity Ring (v = h3-h2) |
|---|---|---|
| Точность линейного зонда | 0.43 (для country) | ~0.32 (случайность) |
| Точность нелинейного зонда | 0.96 | >0.90 (через радиус) |
| Геометрия представления | Вложенные облака (XOR) | Кольцо с нулевым средним |
| Видимость для PCA | Скрыта (общий mean) | Полностью скрыта |
Вывод
Работа демонстрирует, что нейросети могут кодировать информацию в динамике переходов между слоями, а не только в статических активациях. Это создает новые вызовы для AI Safety: стандартные инструменты интерпретируемости, основанные на линейности, могут быть полностью обмануты такими «кольцевыми» структурами, скрывающими критически важные признаки.
Источник: LessWrong ↗
