Исследования22 сентября 2026 г., 01:17 МСК🤖 Auto

CLT-фичи Anthropic: мощный мануфолд, но слабый сигнал управления

Исследование Goodfire Lab показало, что циклический мануфолд «дня недели» в CLT-пространстве Gemma-2-2B существует, но управление через него дает лишь частичный эффект по сравнению с сырыми активациями.

Суть эксперимента: от сырых данных к интерпретируемым фичам

Анна Марбут (Goodfire Lab) продолжила работу по экстракции интерпретируемых признаков (CLT features) от Anthropic для модели Gemma-2-2B. Цель — проверить, можно ли управлять поведением модели, «steering» (управляя) через эти выделенные семантические фичи, а не через сырые векторы активаций. Ключевой тест — наличие циклического мануфолда «дня недели» (day-of-the-week manifold) и возможность плавно перемещаться по нему, меняя выходные вероятности токенов.

Методология: Manifold vs Linear Steering

Исследование сравнивает два метода вмешательства в слой 20 модели (где сигнал дня недели максимален):

  • Linear Steering: Линейная интерполяция между центроидами дней (например, от Понедельника к Четвергу). Это «грубый» метод, который часто пропускает промежуточные состояния.
  • Manifold Steering: Интерполяция по кратчайшему дуге на циклическом мануфолде (через угловую координату θ). Это позволяет модели плавно проходить через все промежуточные дни недели.

Для CLT-пространства использовались топ-64 фичи в слое, отобранные по статистике F между днями. Вмешательство применялось через декодеры транскодеров во всех последующих MLP-блоках, что имитирует естественный поток информации в сети.

Ключевые результаты: Сила сигнала

Хотя циклическая структура подтверждена в CLT-пространстве (визуально оно даже «чище» сырых остаточных потоков), сила управляющего сигнала оказалась значительно слабее. Линейное управление в CLT-пространстве не дает такого резкого сдвига вероятностей, как в сырых активациях.

Параметр Raw Residual Stream CLT Feature Space
Наличие мануфолда Да (подтверждено) Да (подтверждено, «чище»)
Лучший слой для вмешательства Layer 20 Layer 20
Сила steering-сигнала Высокая (резкий сдвиг вероятностей) Слабая/Частичная
Механизм вмешательства Замена вектора активации Запись разницы через декодеры транскодеров

Почему CLT-сигнал слабее?

Авторы объясняют это архитектурной особенностью CLT-фич. Транскодеры обучаются воспроизводить только ту информацию, которую MLP-подслой использует для своей работы. Если семантический сигнал «дня недели» частично хранится в остаточном потоке (residual stream), но не передается в MLP (например, используется только Attention-подслоем), то CLT-фичи его не захватят. Таким образом, CLT-пространство держит лишь часть полного сигнала дня недели, что и приводит к ослаблению эффекта управления.

Значение для индустрии

Результаты показывают, что интерпретируемость (CLT) и управляемость (steering) не всегда коррелируют напрямую. Хотя CLT-фичи дают более чистое представление о семантике, для точечного контроля поведения модели (например, в safety-механизмах) сырые активации или гибридные подходы могут быть эффективнее. Полная реализация эксперимента доступна в Colab-ноутбуке автора.

Источник: LessWrong ↗