Исследования19 августа 2026 г., 05:17 МСК🤖 Auto

Natural Language Transcoders: как AI объясняет вычисления нейросетей

Исследователь Anwen Hao представил Natural Language Transcoders (NLT) — инструмент, который автоматически переводит внутренние изменения активаций трансформеров в человеческие объяснения.

Баннер новости 6040

Суть метода: от активаций к тексту

Метод Natural Language Transcoders (NLT) расширяет концепцию Natural Language Autoencoders (NLA), предложенную Anthropic. Если NLA объясняет состояние одного слоя, то NLT анализирует «дельту» — разницу между входом и выходом стека слоев трансформера. Архитектура включает вербализатор активаций (AV) и реконструктор (AR), которые работают в связке: AV превращает векторную разницу в текст, а AR пытается восстановить исходную разницу из этого текста.

Экспериментальные условия

Для тестирования использовалась модель Qwen2.5-0.5B-Instruct (24 слоя, 896-мерный вектор residual stream). Обучение проходило в два этапа: SFT-предварительная подготовка с помощью учителя и совместное обучение с подкреплением (Joint RL). В качестве входных данных для учителя подавались не только префикс текста, но и метрики изменения логитов, энтропии и маржи.

Результаты: цифры и метрики

После применения RL модель значительно улучшила способность реконструировать векторные изменения и предсказывать поведение целевой модели. Ниже приведено сравнение ключевых метрик на 5000 тестовых примерах:

Метрика После SFT После RL
Raw-delta FVE 0.119 0.503
Raw-delta MSE 3.810 2.150
Delta cosine 0.667 0.818
Prediction KL 5.571 2.221
Target-model top-1 agreement 11.9% 29.5%
Target-model top-5 overlap 18.2% 39.6%

Аудит объяснений: где NLT силен, а где слаб

При ручном аудите 100 сгенерированных объяснений выяснилось, что NLT лучше всего справляется с контекстами, где есть четкие переходы, узкие темы или предсказуемые продолжения (например, числительные или специфические термины). Однако модель часто ошибается в работе с частичными токенами (BPE-фрагменты, даты), именами собственных сущностей и шумными данными. Главная проблема — путаница между фактическим изменением логитов (дельтой) и итоговым результатом генерации.

Планы на будущее

Авторы отмечают, что для решения задач с высокой сложностью и точностью текущей модели 0.5B недостаточно. Следующий шаг — масштабирование эксперимента на базе Qwen2.5-7B-Instruct, что потребует значительных вычислительных ресурсов. Исходный код и результаты доступны на Hugging Face.

Источник: LessWrong ↗