Суть эксперимента: иллюзия понимания
Автор Bobby Faber протестировал интерпретируемость модели Qwen3.5-27B с помощью метода R-Lens (Readout Lens). Цель была простой: найти «скрытые» факты, которые модель знает, но не озвучивает в обычном чате. Изначально R-Lens демонстрировал впечатляющие результаты, значительно превосходя классический J-Lens (Logit Lens) в ранжировании токенов, связанных с известными фактами.
Однако проверка на «ложных» фактах разрушила гипотезу. R-Lens так же хорошо ранжировал неверные утверждения, как и верные. Более того, когда автор заменил факты на случайные английские слова, совпадающие по частотности, преимущество R-Lens сохранилось. Это указывает на то, что метод просто лучше выделяет контентно-насыщенные или частотные токены, а не извлекает семантическое знание.
Методология и цифры
Для тестирования использовался бенчмарк Censored LLM от Casademunt et al. Автор сравнивал эффективность методов на 368 фактах. Ключевая метрика — геометрическое среднее рангов (из ~248 000 токенов в словаре). Чем ниже ранг, тем лучше метод «находит» целевой токен.
| Метод | Геометрическое среднее ранга | Примечание |
|---|---|---|
| R-Lens | ~2 800 | Лучший результат, но не объясняет природу знания |
| J-Lens | ~ 6 600 | Базовый метод для сравнения |
| Logit Lens | ~ 7 500 | Наихудший результат среди протестированных |
Корреляция Спирмана между способностью метода NT0 (elicitation) извлекать факты и преимуществом R-Lens над J-Lens составила ρ = −0.053. Это статистически значимое отсутствие связи: если бы R-Lens действительно «читал» скрытые знания, корреляция была бы положительной.
Почему это важно для AI-индустрии
Результаты ставят под сомнение интерпретируемость как инструмент поиска «секретных» знаний в LLM. Если методы ранжирования токенов реагируют на частотность слов, а не на семантическую истинность, то попытки использовать их для аудита безопасности или поиска скрытых инструкций могут давать ложноположительные срабатывания. R-Lens делает раннее извлечение информации более точным технически, но не гарантирует доступ к латентному контенту модели.
Вопросы для сообщества
Автор признает, что поведенческая часть эксперимента (измерение ΔA — разницы в поддержке факта между обычным чатом и NT0) была шумной. В комментариях он предлагает сообществу LessWrong предложить более информативные тесты, такие как:
- Изменение восстановления факта при использовании разных методов элиситации.
- Использование непрерывных величин, таких как маржа логарифмической вероятности.
- Внутренние вопросы, проверяющие, различает ли чтение токенов конкретные атомарные факты.
Источник: LessWrong ↗
