Суть открытия: «Привилегированная» геометрия
В новой работе, представленной на LessWrong и в препринте arXiv (автор Nelson Guda, август 2026), описывается феномен, названный автором content-based privilege (контентная привилегия). Оказалось, что геометрия остаточных потоков в трансформерах не является однородной «болотом», а строго стратифицирована в зависимости от близости к направлению текущего предсказания модели.
Ключевой вывод: направления, ближайшие к вектору предсказания, решают, какой именно ответ получит модель. Следующие по значимости направления (примерно на 5 токенов дальше во времени) определяют, куда пойдет развитие контекста. Это открытие бросает вызов представлению о том, что вся геометрия скрытых состояний равнозначна.
Методология PDSF и декомпозиция потока
Автор разработал метод PDSF (Prediction-anchored Decomposition into Functional Subspaces), который использует анализ главных компонент (PCA) для удаления направления предсказания и последующей ортогональной проекции остаточной дисперсии. Это позволяет разделить скрытое состояние на четыре строго ортогональных компонента:
- P (Prediction): Направление самого предсказания (вектор unembedding). Оно не несет семантического контента само по себе, но служит якорем.
- D (Dominant): Направление с максимальной дисперсией, ортогональное P. Отвечает за основную вариативность ответа.
- S (Secondary): Следующий слой дисперсии, определяющий дальнейшую эволюцию токена.
- F (Fine/Remainder): Остаточные тысячи измерений, составляющие >99% потока, но несущие минимальную функциональную нагрузку в данном контексте.
Ключевые метрики и наблюдения
Исследование охватило 18 моделей шести различных архитектур, включая базовые и instruction-tuned версии с разбросом в размере параметров в 2.8 раза. Результаты оказались универсальными. Ниже приведена сводка выявленных свойств стратификации:
| Параметр | Наблюдение | Значение для интерпретируемости |
|---|---|---|
| Ортогональность | Вектор предсказания почти ортогонален осям главной дисперсии | Предсказание формируется кумулятивным влиянием, а не одним «сильным» вектором контента. |
| Размерность | Направления с высокой дисперсией относительно предсказания имеют удивительно низкую размерность | Сложные вычисления сжимаются в узкие функциональные подпространства. |
| Манifold complexity | Выше вблизи направления предсказания | Ближе к финальному выбору модель обрабатывает более сложную семантическую информацию. |
| Дискриминация | Снижается, затем резко возрастает при удалении от P | Существует «зона неопределенности», после которой модель начинает четко разделять варианты. |
| Временная стратификация | Поведение модели упорядочено во времени по мере удаления от P | Позволяет предсказывать следующие ~5 токенов, анализируя геометрию потока. |
Отличие от предыдущих работ
Автор подчеркивает, что его «привилегия» отличается от ранее известных концепций:
- Elhage et al. (2023): Описывали «привилегированный базис», связанный с оптимизатором Adam и ориентацией векторов. Это свойство масштаба и обучения, а не семантики.
- Gurnee et al. (Anthropic, 2026): Выделили узкий набор направлений как посредников между поверхностным предсказанием и глубокими вычислениями (logit-lens). Однако методология Guda (PDSF) дает иные, несовместимые результаты, указывая на более широкую и строгую стратификацию всего потока.
Почему это важно?
Это исследование предоставляет новый инструментарий для интерпретируемости ИИ. Понимание того, что геометрия потока «знает» о своей близости к решению, позволяет:
- Точнее локализовать ошибки в рассуждениях моделей (в каких слоях/измерениях происходит сбой дискриминации).
- Разрабатывать методы вмешательства (interventions), которые могут направлять поведение модели, воздействуя на конкретные слои дисперсии (D, S, F), а не на весь поток целиком.
- Уточнять теоретические модели работы трансформеров, учитывая, что «болото» остаточных потоков на самом деле имеет сложную внутреннюю архитектуру.
Автор опубликовал полный код экспериментов, призывая сообщество проверить эти выводы на более крупных моделях.
Источник: LessWrong ↗
