Суть метода: от активаций к тексту
Метод Natural Language Transcoders (NLT) расширяет концепцию Natural Language Autoencoders (NLA), предложенную Anthropic. Если NLA объясняет состояние одного слоя, то NLT анализирует «дельту» — разницу между входом и выходом стека слоев трансформера. Архитектура включает вербализатор активаций (AV) и реконструктор (AR), которые работают в связке: AV превращает векторную разницу в текст, а AR пытается восстановить исходную разницу из этого текста.
Экспериментальные условия
Для тестирования использовалась модель Qwen2.5-0.5B-Instruct (24 слоя, 896-мерный вектор residual stream). Обучение проходило в два этапа: SFT-предварительная подготовка с помощью учителя и совместное обучение с подкреплением (Joint RL). В качестве входных данных для учителя подавались не только префикс текста, но и метрики изменения логитов, энтропии и маржи.
Результаты: цифры и метрики
После применения RL модель значительно улучшила способность реконструировать векторные изменения и предсказывать поведение целевой модели. Ниже приведено сравнение ключевых метрик на 5000 тестовых примерах:
| Метрика | После SFT | После RL |
|---|---|---|
| Raw-delta FVE | 0.119 | 0.503 |
| Raw-delta MSE | 3.810 | 2.150 |
| Delta cosine | 0.667 | 0.818 |
| Prediction KL | 5.571 | 2.221 |
| Target-model top-1 agreement | 11.9% | 29.5% |
| Target-model top-5 overlap | 18.2% | 39.6% |
Аудит объяснений: где NLT силен, а где слаб
При ручном аудите 100 сгенерированных объяснений выяснилось, что NLT лучше всего справляется с контекстами, где есть четкие переходы, узкие темы или предсказуемые продолжения (например, числительные или специфические термины). Однако модель часто ошибается в работе с частичными токенами (BPE-фрагменты, даты), именами собственных сущностей и шумными данными. Главная проблема — путаница между фактическим изменением логитов (дельтой) и итоговым результатом генерации.
Планы на будущее
Авторы отмечают, что для решения задач с высокой сложностью и точностью текущей модели 0.5B недостаточно. Следующий шаг — масштабирование эксперимента на базе Qwen2.5-7B-Instruct, что потребует значительных вычислительных ресурсов. Исходный код и результаты доступны на Hugging Face.
Источник: LessWrong ↗
