Исследования9 июля 2026 г., 10:17 МСК🤖 Auto

NLAs от Anthropic: интерпретируемость или галлюцинации?

Анализ показывает, что новые методы интерпретируемости, такие как Natural Language Autoencoders (NLAs), жертвуют надежностью ради выразительности, создавая риск ложных выводов в безопасности ИИ.

Баннер новости 3184

Парадокс «неинтерпретируемой интерпретируемости»

Исследователь jcksanderson в статье на LessWrong (июль 2026 г.) описывает новую тенденцию в области AI Safety, которую он называет UnInterp (Uninterpretable Interpretability). В отличие от классической механистической интерпретируемости, стремящейся к простым и понятным схемам, новые методы используют сложные, «черные ящики» для анализа нейросетей. Яркий пример — Natural Language Autoencoders (NLAs) от Anthropic, которые пытаются «прочитать мысли» модели, переводя активации в естественный язык.

Как работают NLAs и их цена

NLAs состоят из двух компонентов: Activation Verbalizer (AV) и Activation Reconstructor (AR). AV преобразует сырые активации LLM в текст, а AR пытается восстановить исходные активации обратно. Хотя метод является ненадзорным (unsupervised) и высокоэкспрессивным, он вводит критические проблемы:

  • Конфабуляция: Модели склонны выдумывать информацию, которой нет в остаточном потоке (residual stream).
  • Отсутствие ground-truth: Обучение опирается на «догадки» о содержимом активаций, а не на истинные данные.
  • Высокая стоимость: Выбор правильного слоя для обучения NLA дорог и критичен; ошибка приводит к ложноотрицательным результатам.

Цифры и метрики надежности

Ключевая проблема NLAs — компромисс между доверием и сложностью. Официальная коммуникация от Anthropic часто замалчивает ограничения, но технические данные показывают высокую частоту ошибок:

Метрика / Аспект Значение / Описание
Частота конфабуляции (галлюцинаций) От 35% до 75% объяснений могут быть неверными
Тип метода Unsupervised, высокоэкспрессивный, но «черный ящик»
Рекомендуемое применение Генерация гипотез (не для критически важных решений)
Сравнение с простыми зондами NLA выдают текст, но часто врут; простой зонд не выдает ничего, но и не лжет

Почему это важно для индустрии

Автор статьи предупреждает о серьезном риске для сообщества AI Safety. Из-за плохой коммуникации ограничений NLAs в соцсетях (например, в Twitter-треде) возникли ложные представления, что:

  1. Интерпретируемость уже решена до AGI.
  2. Точность реконструкции верифицирует верность объяснений.
  3. У нас есть методы для выявления «sandbagging» (притворства) и схемных моделей.

На самом деле, NLAs не гарантируют верности описаний. Автор призывает к «мягкому смещению в сторону простоты» и поддержанию доверия к решениям обратно пропорционально их сложности. Пока у нас нет ground-truth для самых важных вопросов безопасности, использование сложных, неинтерпретируемых инструментов для интерпретации несет высокие риски ложных выводов.

Источник: LessWrong ↗