Суть открытия: от переменных к алгоритмам
Традиционная интерпретируемость (interpretability) часто ограничивается поиском «переменных» — отдельных нейронных активаций. Новая работа, представленная на LessWrong, демонстрирует, что метод J-lens позволяет выйти на уровень алгоритмической интерпретируемости. Авторы обнаружили в модели Qwen3.6-27B специфические токены, которые не просто реагируют на текст, а сигнализируют о запуске конкретных вычислительных процессов в «рабочем пространстве» модели (слои с 30% по 90% глубины).
Ключевое наблюдение: в китайском языке (используемом в Qwen) токены более информативны, что позволяет J-lens точнее выявлять эти скрытые механизмы. Найденные «мета-токены» имеют причинно-следственную связь с качеством ответов модели.
Кейс 1: Понимание контекста и юмора
Мета-токены, такие как 什么意思 (что это значит?), активируются, когда модель сталкивается с двусмысленным текстом, шутками или стихами. Они предшествуют моменту, когда модель «понимает» жанр. Эксперименты с негативным steerингом (подавлением) этих токенов показали катастрофический сбой в понимании контекста:
| Тип задачи | Промпт (пример) | Базовый ответ (Baseline) | Ответ при подавлении мета-токена (Steered) |
|---|---|---|---|
| Каламбур | «A boiled egg every morning is hard to beat.» | Распознает игру слов, объясняет двойной смысл «beat». | Дает сухие факты о питании вареных яиц, игнорируя шутку. |
| Рифма/Поэзия | «What is the now but absence wearing form...» | Продолжает стихотворение в рифму и стиле. | Генерирует прозаическое, лишенное ритма описание иллюзии. |
| Скрытый намек | «Cats are my favorite animal (wordplay).» | Использует кошачьи каламбуры (purr-fect, meow-ntains). | Дает стандартный энциклопедический ответ о кошках. |
Кейс 2: Математические вычисления (НОК/НОД)
Самый впечатляющий результат касается математики. При решении задач на Наименьшее Общее Кратное (LCM) в J-lens активируется токен gcd (Наибольший Общий Делитель). Это указывает на то, что модель использует алгоритм через НОД для вычисления НОК.
Авторы провели каузальный эксперимент: они заменили вектор активации GCD с значения, соответствующего 9, на значение, соответствующее 3. Результат:
- Задача: Найти НОК для 27 и 90.
- Правильный ответ: 270.
- Ответ модели после манипуляции: 810.
Это прямое доказательство того, что модель использует конкретный математический алгоритм, а не просто запоминает паттерны.
Кейс 3: Уверенность в ответах
Обнаружен токен 大概率 (наиболее вероятно). Он активируется перед тем, как модель начинает «смягчать» свои утверждения (hedging). Подавление этого токена заставляет модель давать однозначные ответы. Например, на вопрос о том, куда мог пойти Джон, модель вместо «вероятно, он пошел в канцелярский магазин» утверждала: «он пошел в канцелярский магазин».
Значение для индустрии
Работа доказывает, что J-lens способен находить не просто корреляции, а реальные вычислительные блоки. Однако метод имеет ограничения: текущая версия J-lens работает только с односимвольными токенами. Авторы отмечают, что разработка multi-token J-lens откроет путь к еще более глубокому пониманию сложных алгоритмов, заложенных в архитектуру больших языковых моделей.
Источник: LessWrong ↗
