Суть эксперимента: когда линейность обманывает
В задаче интерпретируемости от BlueDot исследователю была предоставлена модель-классификатор на базе all-MiniLM-L6-v2. Текст преобразуется в 384-мерный вектор, проходит через MLP и выдает 8 бинарных признаков: number, question, color, food, sentiment, country, person, body_part. Модель достигает точности выше 95% на всех признаках.
Задача состояла в анализе скрытого слоя (64 измерения) после ReLU. Для семи признаков (число, вопрос, цвет, еда, настроение, человек, часть тела) информация закодирована линейно: достаточно найти один вектор направления w и посмотреть на знак проекции wᵀx. Однако для признака country (страна) этот метод дал сбой.
Доказательство нелинейности: AUC линейного зонда
Автор применил два метода зондирования: линейный (логистическая регрессия) и нелинейный (MLP с одним скрытым слоем). Ключевым метрикой стал AUC, так как он устойчив к дисбалансу классов. Разница в результатах стала первым красным флагом:
| Признак | Linear Probe AUC | MLP Probe AUC | Разница (Gap) |
|---|---|---|---|
| number | 0.997 | 0.997 | 0.000 |
| question | 1.000 | 1.000 | 0.000 |
| color | 0.997 | 0.997 | 0.000 |
| food | 0.996 | 0.995 | -0.001 |
| sentiment | 0.995 | 0.995 | -0.001 |
| country | 0.487 | 0.987 | 0.500 |
| person | 1.000 | 1.000 | 0.000 |
| body_part | 0.999 | 0.998 | -0.001 |
Значение AUC 0.487 для линейного зонда по признаку «country» эквивалентно случайному угадыванию. При этом нелинейный зонд легко восстанавливает информацию (AUC 0.987). Это доказывает, что информация присутствует в активациях, но геометрия её хранения нелинейна.
Исключение ложных срабатываний
Первым шагом автор исключил гипотезу, что «страна» является булевой функцией (XOR, AND, OR) от других признаков. Проверка всех 63 пар признаков показала максимальное совпадение 0.512, что является статистическим шумом. Следовательно, «страна» — это независимый признак, закодированный через сложную геометрию пространства активаций.
Раскрытие механизма: радиус, а не направление
Анализ PCA и визуализация показали, что точки с меткой country=1 сгруппированы ближе к центру облака активаций, а country=0 — разбросаны по периферии. Линейная граница (гиперплоскость) не может разделить эти классы, так как они «окружают» друг друга.
Были проверены гипотезы кодирования:
- Single-centroid model: Точность 0.495 (случайно). Нет единого центра кластера.
- Global scale (норма вектора): AUC 0.21. Классы различаются не просто длиной вектора (инверсная зависимость).
Вывод: признак закодирован через второй порядок границы (distance from center / radial coding). Линейный зонд «слеп» к этому паттерну, так как он реагирует только на проекцию на ось, игнорируя модуль вектора. Это критически важно для исследователей интерпретируемости: стандартные линейные методы могут пропускать до 12.5% информации в таких архитектурах, если не искать нелинейные структуры.
Источник: LessWrong ↗
