Исследования20 июля 2026 г., 23:17 МСК🤖 Auto

J-Space: Как meta-токены раскрывают алгоритмы Qwen3.6

Исследователи из LessWrong обнаружили в Qwen3.6-27B «мета-токены» — скрытые переменные, управляющие логикой модели. От распознавания каламбуров до вычисления НОК.

Баннер новости 3982

Суть открытия: от переменных к алгоритмам

Традиционная интерпретируемость (interpretability) часто ограничивается поиском «переменных» — отдельных нейронных активаций. Новая работа, представленная на LessWrong, демонстрирует, что метод J-lens позволяет выйти на уровень алгоритмической интерпретируемости. Авторы обнаружили в модели Qwen3.6-27B специфические токены, которые не просто реагируют на текст, а сигнализируют о запуске конкретных вычислительных процессов в «рабочем пространстве» модели (слои с 30% по 90% глубины).

Ключевое наблюдение: в китайском языке (используемом в Qwen) токены более информативны, что позволяет J-lens точнее выявлять эти скрытые механизмы. Найденные «мета-токены» имеют причинно-следственную связь с качеством ответов модели.

Кейс 1: Понимание контекста и юмора

Мета-токены, такие как 什么意思 (что это значит?), активируются, когда модель сталкивается с двусмысленным текстом, шутками или стихами. Они предшествуют моменту, когда модель «понимает» жанр. Эксперименты с негативным steerингом (подавлением) этих токенов показали катастрофический сбой в понимании контекста:

Тип задачи Промпт (пример) Базовый ответ (Baseline) Ответ при подавлении мета-токена (Steered)
Каламбур «A boiled egg every morning is hard to beat.» Распознает игру слов, объясняет двойной смысл «beat». Дает сухие факты о питании вареных яиц, игнорируя шутку.
Рифма/Поэзия «What is the now but absence wearing form...» Продолжает стихотворение в рифму и стиле. Генерирует прозаическое, лишенное ритма описание иллюзии.
Скрытый намек «Cats are my favorite animal (wordplay).» Использует кошачьи каламбуры (purr-fect, meow-ntains). Дает стандартный энциклопедический ответ о кошках.

Кейс 2: Математические вычисления (НОК/НОД)

Самый впечатляющий результат касается математики. При решении задач на Наименьшее Общее Кратное (LCM) в J-lens активируется токен gcd (Наибольший Общий Делитель). Это указывает на то, что модель использует алгоритм через НОД для вычисления НОК.

Авторы провели каузальный эксперимент: они заменили вектор активации GCD с значения, соответствующего 9, на значение, соответствующее 3. Результат:

  • Задача: Найти НОК для 27 и 90.
  • Правильный ответ: 270.
  • Ответ модели после манипуляции: 810.

Это прямое доказательство того, что модель использует конкретный математический алгоритм, а не просто запоминает паттерны.

Кейс 3: Уверенность в ответах

Обнаружен токен 大概率 (наиболее вероятно). Он активируется перед тем, как модель начинает «смягчать» свои утверждения (hedging). Подавление этого токена заставляет модель давать однозначные ответы. Например, на вопрос о том, куда мог пойти Джон, модель вместо «вероятно, он пошел в канцелярский магазин» утверждала: «он пошел в канцелярский магазин».

Значение для индустрии

Работа доказывает, что J-lens способен находить не просто корреляции, а реальные вычислительные блоки. Однако метод имеет ограничения: текущая версия J-lens работает только с односимвольными токенами. Авторы отмечают, что разработка multi-token J-lens откроет путь к еще более глубокому пониманию сложных алгоритмов, заложенных в архитектуру больших языковых моделей.

Источник: LessWrong ↗