Исследования3 июля 2026 г., 10:43 МСК🤖 Auto

Как линейный зонд провалился: интерпретируемость скрывает нелинейные паттерны

Исследователь IgorPereverzevDev разобрал первый пазл BlueDot, обнаружив, что модель кодирует признак «страна» через радиус вектора, а не направление, что делает линейные методы анализа слепыми.

Баннер новости 2830

Суть эксперимента: когда линейность обманывает

В задаче интерпретируемости от BlueDot исследователю была предоставлена модель-классификатор на базе all-MiniLM-L6-v2. Текст преобразуется в 384-мерный вектор, проходит через MLP и выдает 8 бинарных признаков: number, question, color, food, sentiment, country, person, body_part. Модель достигает точности выше 95% на всех признаках.

Задача состояла в анализе скрытого слоя (64 измерения) после ReLU. Для семи признаков (число, вопрос, цвет, еда, настроение, человек, часть тела) информация закодирована линейно: достаточно найти один вектор направления w и посмотреть на знак проекции wᵀx. Однако для признака country (страна) этот метод дал сбой.

Доказательство нелинейности: AUC линейного зонда

Автор применил два метода зондирования: линейный (логистическая регрессия) и нелинейный (MLP с одним скрытым слоем). Ключевым метрикой стал AUC, так как он устойчив к дисбалансу классов. Разница в результатах стала первым красным флагом:

Признак Linear Probe AUC MLP Probe AUC Разница (Gap)
number 0.997 0.997 0.000
question 1.000 1.000 0.000
color 0.997 0.997 0.000
food 0.996 0.995 -0.001
sentiment 0.995 0.995 -0.001
country 0.487 0.987 0.500
person 1.000 1.000 0.000
body_part 0.999 0.998 -0.001

Значение AUC 0.487 для линейного зонда по признаку «country» эквивалентно случайному угадыванию. При этом нелинейный зонд легко восстанавливает информацию (AUC 0.987). Это доказывает, что информация присутствует в активациях, но геометрия её хранения нелинейна.

Исключение ложных срабатываний

Первым шагом автор исключил гипотезу, что «страна» является булевой функцией (XOR, AND, OR) от других признаков. Проверка всех 63 пар признаков показала максимальное совпадение 0.512, что является статистическим шумом. Следовательно, «страна» — это независимый признак, закодированный через сложную геометрию пространства активаций.

Раскрытие механизма: радиус, а не направление

Анализ PCA и визуализация показали, что точки с меткой country=1 сгруппированы ближе к центру облака активаций, а country=0 — разбросаны по периферии. Линейная граница (гиперплоскость) не может разделить эти классы, так как они «окружают» друг друга.

Были проверены гипотезы кодирования:

  • Single-centroid model: Точность 0.495 (случайно). Нет единого центра кластера.
  • Global scale (норма вектора): AUC 0.21. Классы различаются не просто длиной вектора (инверсная зависимость).

Вывод: признак закодирован через второй порядок границы (distance from center / radial coding). Линейный зонд «слеп» к этому паттерну, так как он реагирует только на проекцию на ось, игнорируя модуль вектора. Это критически важно для исследователей интерпретируемости: стандартные линейные методы могут пропускать до 12.5% информации в таких архитектурах, если не искать нелинейные структуры.

Источник: LessWrong ↗