Исследования9 июля 2026 г., 04:16 МСК🤖 Auto

Трансформеры сопротивляются своей архитектуре: новые данные

Исследование Zach Baker’а доказывает: обученные веса нейросетей активно противодействуют естественному стремлению токенов к кластеризации и коллапсу, предсказанному математической теорией.

Баннер новости 3164

Суть открытия: Архитектура против Веса

Новое исследование, основанное на работе Geshkovski et al. «A Mathematical Perspective on Transformers», вскрывает фундаментальный парадокс работы современных LLM. Математическая теория доказывает, что если матрицы внимания (Q, K, V) равны единице, токены (представленные как частицы на гиперсфере) неизбежно образуют кластеры и в пределе коллапсируют в одну точку. Однако эксперименты показывают, что обученные веса учатся сопротивляться этому процессу. Трансформер функционирует, удерживая активации в «метастабильных состояниях», предотвращая преждевременную потерю информации.

Экспериментальная настройка и модели

Авторы протестировали гипотезу на нескольких семействах моделей, сравнивая обученные веса с рандомизированными (с сохранением норм). Для анализа использовался алгоритм кластеризации HDBSCAN. Ключевые модели и их параметры:

Семейство Версия Слои (Layers) Измерение (Dim) Примечание
GPT-2 Small 12 768 Базовый тест
GPT-2 Medium 24 1024
GPT-2 Large 36 1280 Основной объект анализа
GPT-2 XL 48 1600
ALBERT v2 Base 12*, 24, 36, 48 768 Разделение весов
ALBERT v2 XL 12, 24*, 36, 48 2048 Разделение весов
BERT Base 12 768 Двунаправленная модель
BERT Large 24 1024 Двунаправленная модель

* — количество слоев, на которых модель проходила обучение.

Ключевые метрики и визуализация

Использование рандомных весов приводит к тому, что проекции активаций (PCA, t-SNE, UMAP) не способны осмысленно распределить пространство — частицы хаотичны. В обученных моделях, таких как GPT-2 Large, наблюдается четкая структура:

  • Частота кластеризации: Токены группируются в кластеры примерно в 50% случаев.
  • Устойчивость: Кластерная структура сохраняется на протяжении многих слоев и различных промптов.
  • Качество: В обученных моделях кластеры содержат меньше частиц, но они более дискретны и стабильны по сравнению с рандомными аналогами.

Почему это важно для интерпретируемости

Результаты подтверждают, что кластеризация — это не артефакт упрощенных математических моделей, а реальное явление в активационном пространстве больших нейросетей. Способность модели «сопротивляться» коллапсу архитектуры через обучение весов является критическим механизмом, позволяющим трансформерам сохранять сложность и разнообразие представлений информации, не теряя их в процессе прохода по слоям.

Источник: LessWrong ↗