Исследования8 августа 2026 г., 06:17 МСК🤖 Auto

CLT-фичи в Gemma-2-2b: как сжатие данных улучшает понимание времени

Исследование Anna Marbut показало, что кросс-слойные транскодеры (CLT) в Gemma-2-2b создают более чистую циклическую структуру для дней недели, чем сырые активации или вероятности токенов.

Баннер новости 5356

Суть открытия: Чистота данных через CLT

Исследовательница Anna Marbut воспроизвела эксперимент Wurgaft et al. (2026) на модели Gemma-2-2b, чтобы проверить, как представление дней недели выглядит в пространстве кросс-слойных транскодеров (CLT). В отличие от сырых активаций нейросети, CLT-фичи, извлеченные из предварительно обученных моделей Anthropic, демонстрируют более четкую и изолированную циклическую геометрию. Это подтверждает, что процесс извлечения фич работает как задумано: он отфильтровывает шум и выделяет семантически чистые концепты.

Методология: Где искать «понимание»

Эксперимент проводился на 20-м слое из 26 модели Gemma-2-2b (аналог 28-го слоя в Llama 3.1 8b, где концепты уже полностью сформированы). Использовался промпт формата "Q: What day is [N] days after [Day]? A:" для фиксации предсказаний модели. Анализировались три пространства:

  • Residual Stream (Активации): Сырые векторы состояния сети.
  • Behavior Space (Поведенческое): Вероятности токенов, преобразованные в пространство Геллинджера (Hellinger space).
  • CLT Features: Векторы, полученные через матричное умножение активаций на энкодер транскодера.

Результаты: Геометрия времени

Проекция PCA показала, что во всех трех пространствах дни недели образуют цикл. Однако CLT-пространство выигрывает по «чистоте»: векторы дней сгруппированы плотнее вокруг центроидов, а корреляции между несмежными днями минимальны. Это означает, что модель четко различает, например, понедельник и пятницу, не путая их с промежуточными днями.

Сравнение нормализованных геодезических расстояний (дуг между центроидами) выявило интересную аномалию в сырых данных:

Пространство Среднее расстояние (регулярность) Наблюдение
Behavior (Output) Самое равномерное Идеальный круг, но менее интерпретируемо на уровне внутренних слоев.
CLT Features Среднее Четкое разделение, слабое влияние «выходного дня».
Activations Наиболее нерегулярное Заметен разрыв между буднями и выходными (когнитивный эффект).

Нерегулярность в сырых активациях (где выходные дни «размазаны» дальше от будней) объясняется когнитивными исследованиями: люди (и модели, обученные на человеческом тексте) обрабатывают выходные и будни по-разному. CLT-фичи сглаживают эту когнитивную «шумность», предоставляя более абстрактную и геометрически стабильную картину.

Почему это важно для AI-индустрии

Главный вывод исследования — CLT-фичи делают интерпретируемость моделей доступнее. Если сырые активации содержат много семантического шума, то CLT-пространство позволяет точнее выявлять и манипулировать концептами (steering). Это открывает путь к созданию более надежных методов контроля над поведением LLM, так как манипуляции в чистом CLT-пространстве будут давать предсказуемые результаты, близкие к поведенческим, но с лучшей прозрачностью механизма.

Источник: LessWrong ↗