Парадокс «неинтерпретируемой интерпретируемости»
Исследователь jcksanderson в статье на LessWrong (июль 2026 г.) описывает новую тенденцию в области AI Safety, которую он называет UnInterp (Uninterpretable Interpretability). В отличие от классической механистической интерпретируемости, стремящейся к простым и понятным схемам, новые методы используют сложные, «черные ящики» для анализа нейросетей. Яркий пример — Natural Language Autoencoders (NLAs) от Anthropic, которые пытаются «прочитать мысли» модели, переводя активации в естественный язык.
Как работают NLAs и их цена
NLAs состоят из двух компонентов: Activation Verbalizer (AV) и Activation Reconstructor (AR). AV преобразует сырые активации LLM в текст, а AR пытается восстановить исходные активации обратно. Хотя метод является ненадзорным (unsupervised) и высокоэкспрессивным, он вводит критические проблемы:
- Конфабуляция: Модели склонны выдумывать информацию, которой нет в остаточном потоке (residual stream).
- Отсутствие ground-truth: Обучение опирается на «догадки» о содержимом активаций, а не на истинные данные.
- Высокая стоимость: Выбор правильного слоя для обучения NLA дорог и критичен; ошибка приводит к ложноотрицательным результатам.
Цифры и метрики надежности
Ключевая проблема NLAs — компромисс между доверием и сложностью. Официальная коммуникация от Anthropic часто замалчивает ограничения, но технические данные показывают высокую частоту ошибок:
| Метрика / Аспект | Значение / Описание |
|---|---|
| Частота конфабуляции (галлюцинаций) | От 35% до 75% объяснений могут быть неверными |
| Тип метода | Unsupervised, высокоэкспрессивный, но «черный ящик» |
| Рекомендуемое применение | Генерация гипотез (не для критически важных решений) |
| Сравнение с простыми зондами | NLA выдают текст, но часто врут; простой зонд не выдает ничего, но и не лжет |
Почему это важно для индустрии
Автор статьи предупреждает о серьезном риске для сообщества AI Safety. Из-за плохой коммуникации ограничений NLAs в соцсетях (например, в Twitter-треде) возникли ложные представления, что:
- Интерпретируемость уже решена до AGI.
- Точность реконструкции верифицирует верность объяснений.
- У нас есть методы для выявления «sandbagging» (притворства) и схемных моделей.
На самом деле, NLAs не гарантируют верности описаний. Автор призывает к «мягкому смещению в сторону простоты» и поддержанию доверия к решениям обратно пропорционально их сложности. Пока у нас нет ground-truth для самых важных вопросов безопасности, использование сложных, неинтерпретируемых инструментов для интерпретации несет высокие риски ложных выводов.
Источник: LessWrong ↗
