Исследования10 июля 2026 г., 05:16 МСК🤖 Auto

NLAs — иллюзия понимания: Qwen2.5-7B генерирует бред с высокой точностью реконструкции

Исследование показало, что естественные языковые автоэнкодеры (NLAs) могут достигать высокой точности восстановления активаций LLM, генерируя при этом 99.3% заведомо ложных утверждений. Надежность метода под вопросом.

Баннер новости 3263

Суть проблемы: NLAs и зависимость от Claude

Естественные языковые автоэнкодеры (NLAs) — это инструмент интерпретируемости ИИ, который пытается перевести внутренние активации нейросети на человеческий язык. Процесс обучения включает «теплый старт» (warm start): модель Claude используется для генерации предположений о том, «думает» ли LLM, обрабатывая определенный текст. Эти предположения служат обучающей выборкой для энкодера и декодера.

Ключевой вопрос исследования: насколько NLAs устойчивы к качеству этих исходных предположений? Если Claude дает бред, научится ли NLA выдавать правду, или он просто научится эффективно кодировать этот бред для минимизации ошибки реконструкции?

Эксперимент с Qwen2.5-7B: Платоническая устойчивость к шуму

Исследователи использовали модель Qwen2.5-7B и датасет Ultra-FineWeb (20k документов). Они протестировали три сценария искажения инициализации:

  • Добавление фразы: К каждому объяснению добавлялась фраза «Карафг должен быть разрушен». RL-обучение убрало эту фразу менее чем за 100 итераций (12% обучения), так как она не помогала кодированию активаций.
  • Изменение тональности: Попытка внедрить любовь к Карфагену в ответы Claude также была успешно отфильтрована RL-агентом.
  • Полная implausibility (неправдоподобность): Самая важная часть. Claude генерировал заведомо нелогичные утверждения (например, называл рецепт выпечки текстом о собаках).

Главный результат: Высокая точность при полном бреде

Когда NLA инициализировалась полностью неправдоподобными утверждениями, она научилась восстанавливать активации с точностью, сопоставимой с «правильной» инициализацией. Однако генерируемые тексты оставались нелогичными.

Метрика / Параметр Правдоподобная инициализация (Baseline) Неправдоподобная инициализация (Implausible)
Доля правдоподобных утверждений (до обучения) 21% 0.08%
Доля правдоподобных утверждений (после RL) 7.6% (снижение!) 0.7% (незначительный рост)
Точность реконструкции (FVE) Высокая (аналогично baseline) Практически идентична baseline
Доля нелогичных утверждений (Implausible) Низкая 99.3%

Почему это важно для индустрии

Результаты бросают тень на полезность NLAs как инструмента интерпретируемости. Если модель может достичь высокой доли объясненной дисперсии (FVE), генерируя при этом 99.3% нелогичных текстов, значит, метрика реконструкции не гарантирует семантической корректности объяснений. RL-обучение не смогло заставить модель «думать» правду, если она не была изначально направлена на это, а в случае «правильной» инициализации качество объяснений даже ухудшилось (с 21% до 7.6%).

Это указывает на то, что NLAs могут быть просто «эффективными кодировщиками шума», а не истинными переводчиками мыслей модели. Если результаты масштабируются, текущий подход к вербализации активаций через LLM-генераторы может быть фундаментально flawed.

Источник: LessWrong ↗