Проблема: NLA «любит детали», даже если они выдуманы
Natural Language Autoencoder (NLA), представленный Anthropic в мае 2026 года, использует две копии модели: вербализатор (AV) и реконструктор (AR). AV переводит внутренние векторы в текст, а AR пытается восстановить исходный вектор по этому тексту. Изначально вознаграждение (reward) зависело только от качества реконструкции (метрика FVE — Fraction of Variance Explained).
Автор исследования обнаружил критический баг: AV генерирует конфабуляции (выдуманные факты), которые, парадоксальным образом, несут наибольшую информационную нагрузку для реконструкции. В тесте на модели Qwen 3.6-27B около 90% конкретных утверждений AV (имена, цифры, цитаты) не подтверждались исходным текстом. При этом замена абстрактных понятий на абстрактные снижала FVE лишь на 0.072, а замена конкретных сущностей (например, «Bing Maps» на «Stripe Payment») обрушивала реконструкцию на 0.89.
Решение: Штраф за фактическую неточность
Хонг модифицировал функцию вознаграждения, добавив компонент fact_checking. Он извлекает именованные сущности из текста AV, ищет их в исходных токенах активации и рассчитывает долю совпадений (g). Если AV говорит «Джейк», а в тексте «Майк», коэффициент g падает, и модель получает меньшее вознаграждение.
Результаты: Точность против Реконструкции
Введение нового штрафа позволило обучить модель говорить правду, не жертвуя способностью восстанавливать векторы. Ниже приведены ключевые метрики сравнения базовой версии Anthropic и модифицированной версии автора:
| Метрика / Параметр | Базовая NLA (Anthropic) | NLA с фиксом (Хонг) |
|---|---|---|
| Доля правдивых утверждений (LLM Judge) | 54.5% [45.2%, 63.5%] | 83.6% [75.6%, 89.4%] |
| Финальный FVE (Reconstruction) | 0.712 (на held-out split) | 0.4194 (на локальном Qwen 3.6-27B, старт 0.124) |
| Влияние замены сущностей на FVE | Сильное падение (зависимость от деталей) | Сохранена способность реконструкции, но детали теперь верны |
Почему это важно для интерпретируемости
Исследование показывает, что верность текста (faithfulness) — это свойство канала передачи, а не самого пространства активаций. Анализ «J-space» (вербализуемого подпространства, занимающего 6-7% энергии активации) показал, что 95% прироста реконструкции происходит вне этого пространства. Фикс вознаграждения изменил то, какие слова несут информацию, но не изменил архитектуру пространства активаций. Это первый шаг к созданию инструментов интерпретируемости, которым можно доверять, а не просто «читать мысли» модели, основываясь на её галлюцинациях.
Источник: LessWrong ↗
