Исследования24 июля 2026 г., 04:18 МСК🤖 Auto

Как обмануть NLA: фикс вознаграждения убирает конфабуляции в интерпретируемости

Исследователь Сеонг Пё Хонг показал, что NLA от Anthropic генерирует правдоподобный, но ложный текст. Добавление штрафа за фактические ошибки в функцию вознаграждения повысило точность интерпретации с 54% до 83% без потери качества реконструкции.

Баннер новости 4257

Проблема: NLA «любит детали», даже если они выдуманы

Natural Language Autoencoder (NLA), представленный Anthropic в мае 2026 года, использует две копии модели: вербализатор (AV) и реконструктор (AR). AV переводит внутренние векторы в текст, а AR пытается восстановить исходный вектор по этому тексту. Изначально вознаграждение (reward) зависело только от качества реконструкции (метрика FVE — Fraction of Variance Explained).

Автор исследования обнаружил критический баг: AV генерирует конфабуляции (выдуманные факты), которые, парадоксальным образом, несут наибольшую информационную нагрузку для реконструкции. В тесте на модели Qwen 3.6-27B около 90% конкретных утверждений AV (имена, цифры, цитаты) не подтверждались исходным текстом. При этом замена абстрактных понятий на абстрактные снижала FVE лишь на 0.072, а замена конкретных сущностей (например, «Bing Maps» на «Stripe Payment») обрушивала реконструкцию на 0.89.

Решение: Штраф за фактическую неточность

Хонг модифицировал функцию вознаграждения, добавив компонент fact_checking. Он извлекает именованные сущности из текста AV, ищет их в исходных токенах активации и рассчитывает долю совпадений (g). Если AV говорит «Джейк», а в тексте «Майк», коэффициент g падает, и модель получает меньшее вознаграждение.

Результаты: Точность против Реконструкции

Введение нового штрафа позволило обучить модель говорить правду, не жертвуя способностью восстанавливать векторы. Ниже приведены ключевые метрики сравнения базовой версии Anthropic и модифицированной версии автора:

Метрика / Параметр Базовая NLA (Anthropic) NLA с фиксом (Хонг)
Доля правдивых утверждений (LLM Judge) 54.5% [45.2%, 63.5%] 83.6% [75.6%, 89.4%]
Финальный FVE (Reconstruction) 0.712 (на held-out split) 0.4194 (на локальном Qwen 3.6-27B, старт 0.124)
Влияние замены сущностей на FVE Сильное падение (зависимость от деталей) Сохранена способность реконструкции, но детали теперь верны

Почему это важно для интерпретируемости

Исследование показывает, что верность текста (faithfulness) — это свойство канала передачи, а не самого пространства активаций. Анализ «J-space» (вербализуемого подпространства, занимающего 6-7% энергии активации) показал, что 95% прироста реконструкции происходит вне этого пространства. Фикс вознаграждения изменил то, какие слова несут информацию, но не изменил архитектуру пространства активаций. Это первый шаг к созданию инструментов интерпретируемости, которым можно доверять, а не просто «читать мысли» модели, основываясь на её галлюцинациях.

Источник: LessWrong ↗