Суть эксперимента: от сырых данных к интерпретируемым фичам
Анна Марбут (Goodfire Lab) продолжила работу по экстракции интерпретируемых признаков (CLT features) от Anthropic для модели Gemma-2-2B. Цель — проверить, можно ли управлять поведением модели, «steering» (управляя) через эти выделенные семантические фичи, а не через сырые векторы активаций. Ключевой тест — наличие циклического мануфолда «дня недели» (day-of-the-week manifold) и возможность плавно перемещаться по нему, меняя выходные вероятности токенов.
Методология: Manifold vs Linear Steering
Исследование сравнивает два метода вмешательства в слой 20 модели (где сигнал дня недели максимален):
- Linear Steering: Линейная интерполяция между центроидами дней (например, от Понедельника к Четвергу). Это «грубый» метод, который часто пропускает промежуточные состояния.
- Manifold Steering: Интерполяция по кратчайшему дуге на циклическом мануфолде (через угловую координату θ). Это позволяет модели плавно проходить через все промежуточные дни недели.
Для CLT-пространства использовались топ-64 фичи в слое, отобранные по статистике F между днями. Вмешательство применялось через декодеры транскодеров во всех последующих MLP-блоках, что имитирует естественный поток информации в сети.
Ключевые результаты: Сила сигнала
Хотя циклическая структура подтверждена в CLT-пространстве (визуально оно даже «чище» сырых остаточных потоков), сила управляющего сигнала оказалась значительно слабее. Линейное управление в CLT-пространстве не дает такого резкого сдвига вероятностей, как в сырых активациях.
| Параметр | Raw Residual Stream | CLT Feature Space |
|---|---|---|
| Наличие мануфолда | Да (подтверждено) | Да (подтверждено, «чище») |
| Лучший слой для вмешательства | Layer 20 | Layer 20 |
| Сила steering-сигнала | Высокая (резкий сдвиг вероятностей) | Слабая/Частичная |
| Механизм вмешательства | Замена вектора активации | Запись разницы через декодеры транскодеров |
Почему CLT-сигнал слабее?
Авторы объясняют это архитектурной особенностью CLT-фич. Транскодеры обучаются воспроизводить только ту информацию, которую MLP-подслой использует для своей работы. Если семантический сигнал «дня недели» частично хранится в остаточном потоке (residual stream), но не передается в MLP (например, используется только Attention-подслоем), то CLT-фичи его не захватят. Таким образом, CLT-пространство держит лишь часть полного сигнала дня недели, что и приводит к ослаблению эффекта управления.
Значение для индустрии
Результаты показывают, что интерпретируемость (CLT) и управляемость (steering) не всегда коррелируют напрямую. Хотя CLT-фичи дают более чистое представление о семантике, для точечного контроля поведения модели (например, в safety-механизмах) сырые активации или гибридные подходы могут быть эффективнее. Полная реализация эксперимента доступна в Colab-ноутбуке автора.
Источник: LessWrong ↗