Исследования30 сентября 2026 г., 20:22 МСК🤖 Auto

VPD-аудит: объяснения моделей не суммируются, а ломают логику

Независимый аудит метода adVersarial Parameter Decomposition (VPD) показал, что агрегация «объяснимых» компонентов весов приводит к значительному дрейфу выходов модели, делая метод непригодным для безопасного редактирования.

Баннер новости 8625

Суть проблемы: обещание против реальности

Метод VPD (adVersarial Parameter Decomposition) позиционируется как инструмент для интерпретируемости ИИ, позволяющий разлагать веса нейросети на простые компоненты. Авторы заявляют, что каждый компонент можно пометить как «необходимый» или «безопасный для удаления» для каждого токена входа. Ключевое обещание метода — агрегация: если мы объединим объяснения для разных входов, модель должна сохранить свои выходные данные, так как компоненты работают независимо.

Однако независимый аудит, проведенный Томом Ангстеном (Tom Angsten) и опубликованный на LessWrong, выявил критический разрыв между теорией и практикой. При агрегации объяснений от разных текстов выходы модели начинают систематически дрейфовать от оригинальных, что свидетельствует о нарушении механистической верности (mechanistic faithfulness) компонентов.

Ключевые метрики и результаты

Аудит проводился на выпущенной декомпозиции модели с 4 слоями и 67 млн параметров. Исследователи измеряли расхождение (KL-divergence) между оригинальной моделью и моделью с агрегированными компонентами. Результаты оказались разрушительными для заявленных преимуществ метода:

  • Быстрая деградация: Уже при агрегации компонентов, необходимых для 64 токенов (примерно 4 500 компонентов), расхождение достигает 0.80 нат. Это сопоставимо с ущербом, наносимым собственным 20-шаговым adversary-атакой авторов оригинальной статьи (0.83 нат).
  • Эффект «удаления всего лишнего»: Удаление всех компонентов, которые ни разу не были помечены как «необходимые», сдвигает модель на 1.28 нат по KL-дивергенции. Это означает, что модель теряет значительную часть своей исходной функциональности, даже не затрагивая явно «полезные» веса.
  • Код против текста: Агрегация наносит больший урон способности модели писать код, чем её способности генерировать обычный текст, что делает метод рискованным для технических задач.

Почему это важно для индустрии

Если компоненты не являются механистически верными, то утверждение, что «отключение ненужных весов не меняет поведение модели», ложно. На практике это означает:

  1. Невозможность безопасного редактирования: Нельзя просто вырезать «вредные» компоненты, ожидая, что остальная часть модели останется неизменной. Удаление весов, помеченных как «безопасные», всё равно влияет на глобальное поведение.
  2. Проблема интерпретируемости: Если объяснения (labels) не агрегируются, то локальные объяснения для отдельных токенов не дают достоверной картины о том, как модель принимает решения в более широком контексте.

Авторы оригинальной статьи VPD сами признавали: «Остается неясным, достаточно ли наша текущая декомпозиция устойчива к атакам для этой цели». Данный аудит подтверждает, что для текущей версии метода ответ — нет. Практикующим специалистам следует относиться к VPD-объяснениям с осторожностью и не использовать их для критических изменений архитектуры или весов моделей.

Источник: LessWrong ↗