Суть метода: от активаций к тексту и обратно
Natural Language Autoencoders (NLAs) — это интерпретируемая архитектура, состоящая из двух компонентов: вербализатора (AV) и реконструктора (AR). Процесс работает так:
- Вербализатор (AV): Принимает активации (residual stream) на определенном слое базовой модели (обычно ~2/3 глубины) и генерирует текстовое объяснение (~150 токенов).
- Реконструктор (AR): Принимает это текстовое объяснение и пытается восстановить исходные активации.
- Цель: Минимизировать ошибку реконструкции. Обучение включает warm-up SFT на синтетических данных и RL с KL-штрафом для сохранения формата.
Результаты: Высокая точность, но проблема «конфабуляций»
На открытых весах (open-weights) метод демонстрирует высокую эффективность: 0.77 fraction-of-variance-explained (доля объясненной дисперсии). Однако анализ показал, что вербализаторы склонны генерировать «сниппеты» — выдуманные цитаты из исходного промпта, которые не всегда отражают истинную семантику активаций.
Пример объяснения от Opus 4.6 для промпта с рифмой про морковку:
| Компонент | Детали |
|---|---|
| Исходный промпт | A rhyming couplet: He saw a carrot and had to grab it |
| Генерируемое объяснение (AV) | Описывает структуру как «limerick/poem structure», упоминает «greedy rabbit», «children's verse» и «amateur content» |
| Ключевой вывод | Текст выглядит осмысленно, но содержит конфабулированные детали (кролики), которых не было в контексте, что ставит под вопрос чистоту интерпретации |
Кросс-модельная универсальность
Один из самых интригующих результатов — способность вербализации работать кросс-модельно. Формат объяснений, выученный на одной модели (например, Opus), может быть применен к другим моделям и даже другим семействам моделей, сохраняя семантическую связность. Это позволяет использовать NLAs для аудита скрытых целей (hidden objectives) и отслеживания нежелательного поведения.
Почему это важно для индустрии
Хотя NLAs открывают новые горизонты в интерпретируемости (auditability, steerability), текущая архитектура страдает от произвольности в выборе формата и склонности к генерации правдоподобного, но ложного текста. Автор статьи предполагает, что для получения надежных интерпретаций необходимо либо изменить архитектуру NLAs, либо пересмотреть процесс обучения, чтобы подавить конфабуляции и сделать вербализацию более строгой.
Источник: LessWrong ↗
