Суть проблемы: NLAs и зависимость от Claude
Естественные языковые автоэнкодеры (NLAs) — это инструмент интерпретируемости ИИ, который пытается перевести внутренние активации нейросети на человеческий язык. Процесс обучения включает «теплый старт» (warm start): модель Claude используется для генерации предположений о том, «думает» ли LLM, обрабатывая определенный текст. Эти предположения служат обучающей выборкой для энкодера и декодера.
Ключевой вопрос исследования: насколько NLAs устойчивы к качеству этих исходных предположений? Если Claude дает бред, научится ли NLA выдавать правду, или он просто научится эффективно кодировать этот бред для минимизации ошибки реконструкции?
Эксперимент с Qwen2.5-7B: Платоническая устойчивость к шуму
Исследователи использовали модель Qwen2.5-7B и датасет Ultra-FineWeb (20k документов). Они протестировали три сценария искажения инициализации:
- Добавление фразы: К каждому объяснению добавлялась фраза «Карафг должен быть разрушен». RL-обучение убрало эту фразу менее чем за 100 итераций (12% обучения), так как она не помогала кодированию активаций.
- Изменение тональности: Попытка внедрить любовь к Карфагену в ответы Claude также была успешно отфильтрована RL-агентом.
- Полная implausibility (неправдоподобность): Самая важная часть. Claude генерировал заведомо нелогичные утверждения (например, называл рецепт выпечки текстом о собаках).
Главный результат: Высокая точность при полном бреде
Когда NLA инициализировалась полностью неправдоподобными утверждениями, она научилась восстанавливать активации с точностью, сопоставимой с «правильной» инициализацией. Однако генерируемые тексты оставались нелогичными.
| Метрика / Параметр | Правдоподобная инициализация (Baseline) | Неправдоподобная инициализация (Implausible) |
|---|---|---|
| Доля правдоподобных утверждений (до обучения) | 21% | 0.08% |
| Доля правдоподобных утверждений (после RL) | 7.6% (снижение!) | 0.7% (незначительный рост) |
| Точность реконструкции (FVE) | Высокая (аналогично baseline) | Практически идентична baseline |
| Доля нелогичных утверждений (Implausible) | Низкая | 99.3% |
Почему это важно для индустрии
Результаты бросают тень на полезность NLAs как инструмента интерпретируемости. Если модель может достичь высокой доли объясненной дисперсии (FVE), генерируя при этом 99.3% нелогичных текстов, значит, метрика реконструкции не гарантирует семантической корректности объяснений. RL-обучение не смогло заставить модель «думать» правду, если она не была изначально направлена на это, а в случае «правильной» инициализации качество объяснений даже ухудшилось (с 21% до 7.6%).
Это указывает на то, что NLAs могут быть просто «эффективными кодировщиками шума», а не истинными переводчиками мыслей модели. Если результаты масштабируются, текущий подход к вербализации активаций через LLM-генераторы может быть фундаментально flawed.
Источник: LessWrong ↗
