Суть открытия: Чистота данных через CLT
Исследовательница Anna Marbut воспроизвела эксперимент Wurgaft et al. (2026) на модели Gemma-2-2b, чтобы проверить, как представление дней недели выглядит в пространстве кросс-слойных транскодеров (CLT). В отличие от сырых активаций нейросети, CLT-фичи, извлеченные из предварительно обученных моделей Anthropic, демонстрируют более четкую и изолированную циклическую геометрию. Это подтверждает, что процесс извлечения фич работает как задумано: он отфильтровывает шум и выделяет семантически чистые концепты.
Методология: Где искать «понимание»
Эксперимент проводился на 20-м слое из 26 модели Gemma-2-2b (аналог 28-го слоя в Llama 3.1 8b, где концепты уже полностью сформированы). Использовался промпт формата "Q: What day is [N] days after [Day]? A:" для фиксации предсказаний модели. Анализировались три пространства:
- Residual Stream (Активации): Сырые векторы состояния сети.
- Behavior Space (Поведенческое): Вероятности токенов, преобразованные в пространство Геллинджера (Hellinger space).
- CLT Features: Векторы, полученные через матричное умножение активаций на энкодер транскодера.
Результаты: Геометрия времени
Проекция PCA показала, что во всех трех пространствах дни недели образуют цикл. Однако CLT-пространство выигрывает по «чистоте»: векторы дней сгруппированы плотнее вокруг центроидов, а корреляции между несмежными днями минимальны. Это означает, что модель четко различает, например, понедельник и пятницу, не путая их с промежуточными днями.
Сравнение нормализованных геодезических расстояний (дуг между центроидами) выявило интересную аномалию в сырых данных:
| Пространство | Среднее расстояние (регулярность) | Наблюдение |
|---|---|---|
| Behavior (Output) | Самое равномерное | Идеальный круг, но менее интерпретируемо на уровне внутренних слоев. |
| CLT Features | Среднее | Четкое разделение, слабое влияние «выходного дня». |
| Activations | Наиболее нерегулярное | Заметен разрыв между буднями и выходными (когнитивный эффект). |
Нерегулярность в сырых активациях (где выходные дни «размазаны» дальше от будней) объясняется когнитивными исследованиями: люди (и модели, обученные на человеческом тексте) обрабатывают выходные и будни по-разному. CLT-фичи сглаживают эту когнитивную «шумность», предоставляя более абстрактную и геометрически стабильную картину.
Почему это важно для AI-индустрии
Главный вывод исследования — CLT-фичи делают интерпретируемость моделей доступнее. Если сырые активации содержат много семантического шума, то CLT-пространство позволяет точнее выявлять и манипулировать концептами (steering). Это открывает путь к созданию более надежных методов контроля над поведением LLM, так как манипуляции в чистом CLT-пространстве будут давать предсказуемые результаты, близкие к поведенческим, но с лучшей прозрачностью механизма.
Источник: LessWrong ↗
