Исследования9 июля 2026 г., 23:16 МСК🤖 Auto

NLAs: Автоэнкодеры языка — это суммаризаторы или больше?

Исследование Andrey Anurin показывает, что Natural Language Autoencoders (NLAs) эффективно реконструируют активации моделей, но их объяснения часто содержат конфабуляции. Автор предлагает изменить архитектуру или процесс обучения.

Баннер новости 3244

Суть метода: от активаций к тексту и обратно

Natural Language Autoencoders (NLAs) — это интерпретируемая архитектура, состоящая из двух компонентов: вербализатора (AV) и реконструктора (AR). Процесс работает так:

  • Вербализатор (AV): Принимает активации (residual stream) на определенном слое базовой модели (обычно ~2/3 глубины) и генерирует текстовое объяснение (~150 токенов).
  • Реконструктор (AR): Принимает это текстовое объяснение и пытается восстановить исходные активации.
  • Цель: Минимизировать ошибку реконструкции. Обучение включает warm-up SFT на синтетических данных и RL с KL-штрафом для сохранения формата.

Результаты: Высокая точность, но проблема «конфабуляций»

На открытых весах (open-weights) метод демонстрирует высокую эффективность: 0.77 fraction-of-variance-explained (доля объясненной дисперсии). Однако анализ показал, что вербализаторы склонны генерировать «сниппеты» — выдуманные цитаты из исходного промпта, которые не всегда отражают истинную семантику активаций.

Пример объяснения от Opus 4.6 для промпта с рифмой про морковку:

Компонент Детали
Исходный промпт A rhyming couplet: He saw a carrot and had to grab it
Генерируемое объяснение (AV) Описывает структуру как «limerick/poem structure», упоминает «greedy rabbit», «children's verse» и «amateur content»
Ключевой вывод Текст выглядит осмысленно, но содержит конфабулированные детали (кролики), которых не было в контексте, что ставит под вопрос чистоту интерпретации

Кросс-модельная универсальность

Один из самых интригующих результатов — способность вербализации работать кросс-модельно. Формат объяснений, выученный на одной модели (например, Opus), может быть применен к другим моделям и даже другим семействам моделей, сохраняя семантическую связность. Это позволяет использовать NLAs для аудита скрытых целей (hidden objectives) и отслеживания нежелательного поведения.

Почему это важно для индустрии

Хотя NLAs открывают новые горизонты в интерпретируемости (auditability, steerability), текущая архитектура страдает от произвольности в выборе формата и склонности к генерации правдоподобного, но ложного текста. Автор статьи предполагает, что для получения надежных интерпретаций необходимо либо изменить архитектуру NLAs, либо пересмотреть процесс обучения, чтобы подавить конфабуляции и сделать вербализацию более строгой.

Источник: LessWrong ↗