Исследования18 сентября 2026 г., 04:17 МСК🤖 Auto

R-Lens не читает мысли: почему ранжирование токенов не равно знанию

Исследование показало, что метод R-Lens лучше J-Lens ранжирует токены в Qwen3.5, но это связано не с доступом к скрытым фактам, а с частотой слов. Метод не может отличить истину от вымысла.

Баннер новости 7759

Суть эксперимента: иллюзия понимания

Автор Bobby Faber протестировал интерпретируемость модели Qwen3.5-27B с помощью метода R-Lens (Readout Lens). Цель была простой: найти «скрытые» факты, которые модель знает, но не озвучивает в обычном чате. Изначально R-Lens демонстрировал впечатляющие результаты, значительно превосходя классический J-Lens (Logit Lens) в ранжировании токенов, связанных с известными фактами.

Однако проверка на «ложных» фактах разрушила гипотезу. R-Lens так же хорошо ранжировал неверные утверждения, как и верные. Более того, когда автор заменил факты на случайные английские слова, совпадающие по частотности, преимущество R-Lens сохранилось. Это указывает на то, что метод просто лучше выделяет контентно-насыщенные или частотные токены, а не извлекает семантическое знание.

Методология и цифры

Для тестирования использовался бенчмарк Censored LLM от Casademunt et al. Автор сравнивал эффективность методов на 368 фактах. Ключевая метрика — геометрическое среднее рангов (из ~248 000 токенов в словаре). Чем ниже ранг, тем лучше метод «находит» целевой токен.

Метод Геометрическое среднее ранга Примечание
R-Lens ~2 800 Лучший результат, но не объясняет природу знания
J-Lens ~ 6 600 Базовый метод для сравнения
Logit Lens ~ 7 500 Наихудший результат среди протестированных

Корреляция Спирмана между способностью метода NT0 (elicitation) извлекать факты и преимуществом R-Lens над J-Lens составила ρ = −0.053. Это статистически значимое отсутствие связи: если бы R-Lens действительно «читал» скрытые знания, корреляция была бы положительной.

Почему это важно для AI-индустрии

Результаты ставят под сомнение интерпретируемость как инструмент поиска «секретных» знаний в LLM. Если методы ранжирования токенов реагируют на частотность слов, а не на семантическую истинность, то попытки использовать их для аудита безопасности или поиска скрытых инструкций могут давать ложноположительные срабатывания. R-Lens делает раннее извлечение информации более точным технически, но не гарантирует доступ к латентному контенту модели.

Вопросы для сообщества

Автор признает, что поведенческая часть эксперимента (измерение ΔA — разницы в поддержке факта между обычным чатом и NT0) была шумной. В комментариях он предлагает сообществу LessWrong предложить более информативные тесты, такие как:

  • Изменение восстановления факта при использовании разных методов элиситации.
  • Использование непрерывных величин, таких как маржа логарифмической вероятности.
  • Внутренние вопросы, проверяющие, различает ли чтение токенов конкретные атомарные факты.

Источник: LessWrong ↗