Суть открытия: Архитектура против Веса
Новое исследование, основанное на работе Geshkovski et al. «A Mathematical Perspective on Transformers», вскрывает фундаментальный парадокс работы современных LLM. Математическая теория доказывает, что если матрицы внимания (Q, K, V) равны единице, токены (представленные как частицы на гиперсфере) неизбежно образуют кластеры и в пределе коллапсируют в одну точку. Однако эксперименты показывают, что обученные веса учатся сопротивляться этому процессу. Трансформер функционирует, удерживая активации в «метастабильных состояниях», предотвращая преждевременную потерю информации.
Экспериментальная настройка и модели
Авторы протестировали гипотезу на нескольких семействах моделей, сравнивая обученные веса с рандомизированными (с сохранением норм). Для анализа использовался алгоритм кластеризации HDBSCAN. Ключевые модели и их параметры:
| Семейство | Версия | Слои (Layers) | Измерение (Dim) | Примечание |
|---|---|---|---|---|
| GPT-2 | Small | 12 | 768 | Базовый тест |
| GPT-2 | Medium | 24 | 1024 | — |
| GPT-2 | Large | 36 | 1280 | Основной объект анализа |
| GPT-2 | XL | 48 | 1600 | — |
| ALBERT | v2 Base | 12*, 24, 36, 48 | 768 | Разделение весов |
| ALBERT | v2 XL | 12, 24*, 36, 48 | 2048 | Разделение весов |
| BERT | Base | 12 | 768 | Двунаправленная модель |
| BERT | Large | 24 | 1024 | Двунаправленная модель |
* — количество слоев, на которых модель проходила обучение.
Ключевые метрики и визуализация
Использование рандомных весов приводит к тому, что проекции активаций (PCA, t-SNE, UMAP) не способны осмысленно распределить пространство — частицы хаотичны. В обученных моделях, таких как GPT-2 Large, наблюдается четкая структура:
- Частота кластеризации: Токены группируются в кластеры примерно в 50% случаев.
- Устойчивость: Кластерная структура сохраняется на протяжении многих слоев и различных промптов.
- Качество: В обученных моделях кластеры содержат меньше частиц, но они более дискретны и стабильны по сравнению с рандомными аналогами.
Почему это важно для интерпретируемости
Результаты подтверждают, что кластеризация — это не артефакт упрощенных математических моделей, а реальное явление в активационном пространстве больших нейросетей. Способность модели «сопротивляться» коллапсу архитектуры через обучение весов является критическим механизмом, позволяющим трансформерам сохранять сложность и разнообразие представлений информации, не теряя их в процессе прохода по слоям.
Источник: LessWrong ↗
