Что такое Ignition Index и зачем он нужен
Авторы вводят скалярную метрику Ignition Index (I), которая операционализирует предсказание теории глобального рабочего пространства (Global Workspace Theory, GWT) о переходе «все или ничего». В контексте трансформеров это означает способность модели не просто плавно накапливать информацию, а резко «зажигать» глобальный сигнал, делая его доступным для всех модулей системы.
Метрика вычисляется путем подбора сигмоиды с четырьмя параметрами к точности линейного зонда (linear probe) на каждом слое в зависимости от силы входного сигнала. Ключевым параметром является крутизна beta-hat ($\hat{\beta}$): высокие значения указывают на резкий, подобный озарению переход, а низкие — на постепенное накопление.
Архитектурные различия: Трансформеры против SSM
Исследование охватило 11 моделей из пяти архитектурных семейств. Контрольные эксперименты с перемешанными метками (shuffled-label controls) показали, что метрика обладает высокой специфичностью: она различает настоящую лингвистическую структуру и спurious-емкость зонда с коэффициентом 9.6 (p < 0.001, тест Манна-Уитни).
Главное открытие касается сравнения классических трансформеров и структур состояний (SSM), таких как Mamba. Трансформеры демонстрируют значительно более выраженные эффекты «озарения»:
| Характеристика | Feedforward Transformers | SSM (Mamba) |
|---|---|---|
| Разница в aggregate beta-hat | Базовый уровень | Ниже на 89% |
| Характер профиля | Резкий переход (ignition-like) | Почти линейный |
| Интерпретация | Наличие глобального вещания | Отсутствие глобального вещания |
| p < 1e-13, Cohen's d = 0.52 | ||
Рекуррентные архитектуры и раннее обучение
Исследование также выявило интересные паттерны в рекуррентных моделях. Модель Huginn-3.5B демонстрирует индекс озарения, который в 2.12 раза выше вдоль оси итераций (рекуррентности), чем вдоль оси глубины. Это подтверждает гипотезу, чтоworkspace-подобные переходы в таких архитектурах проявляются именно через рекуррентные связи.
Кроме того, на модели Pythia-410M был обнаружен фазовый переход с помощью алгоритма PELT на шаге обучения 256. Этот скачок (+67%) произошел задолго до формирования «индукционных голов» (induction heads), что позволяет использовать Ignition Index для раннего обнаружения критических точек в процессе обучения.
Почему масштаб и сила сигнала не сработали
Ожидания, что индекс озарения будет линейно расти с увеличением масштаба модели или силы входного сигнала, не подтвердились. Результаты suggest, что архитектуры трансформеров могут достигать предела насыщения доступных механизмов озарения, после чего дальнейшее масштабирование не приводит к качественному изменению динамики GWT.
Значение для интрпретируемости
Ignition Index становится первым валидированным количественным мостом между динамическими предсказаниями GWT и механистической интерпретируемостью. Он обеспечивает уровень дискриминации на уровне архитектуры, который ранее не характеризовался в литературе по масштабированию моделей.
Источник: arXiv cs.AI ↗
