Исследования7 августа 2026 г., 07:17 МСК🤖 Auto

Ignition Index: как измерить «озарение» в LLM по теории глобального рабочего пространства

Исследователь Саман Рахбар представил метрику Ignition Index (I), которая количественно оценивает способность языковых моделей к резкому переходу к осознанной обработке информации, подтверждая гипотезы теории глобального рабочего пространства (GWT).

Баннер новости 5273

Что такое Ignition Index и зачем он нужен

Авторы вводят скалярную метрику Ignition Index (I), которая операционализирует предсказание теории глобального рабочего пространства (Global Workspace Theory, GWT) о переходе «все или ничего». В контексте трансформеров это означает способность модели не просто плавно накапливать информацию, а резко «зажигать» глобальный сигнал, делая его доступным для всех модулей системы.

Метрика вычисляется путем подбора сигмоиды с четырьмя параметрами к точности линейного зонда (linear probe) на каждом слое в зависимости от силы входного сигнала. Ключевым параметром является крутизна beta-hat ($\hat{\beta}$): высокие значения указывают на резкий, подобный озарению переход, а низкие — на постепенное накопление.

Архитектурные различия: Трансформеры против SSM

Исследование охватило 11 моделей из пяти архитектурных семейств. Контрольные эксперименты с перемешанными метками (shuffled-label controls) показали, что метрика обладает высокой специфичностью: она различает настоящую лингвистическую структуру и спurious-емкость зонда с коэффициентом 9.6 (p < 0.001, тест Манна-Уитни).

Главное открытие касается сравнения классических трансформеров и структур состояний (SSM), таких как Mamba. Трансформеры демонстрируют значительно более выраженные эффекты «озарения»:

d>Статистическая значимость
Характеристика Feedforward Transformers SSM (Mamba)
Разница в aggregate beta-hat Базовый уровень Ниже на 89%
Характер профиля Резкий переход (ignition-like) Почти линейный
Интерпретация Наличие глобального вещания Отсутствие глобального вещания
p < 1e-13, Cohen's d = 0.52

Рекуррентные архитектуры и раннее обучение

Исследование также выявило интересные паттерны в рекуррентных моделях. Модель Huginn-3.5B демонстрирует индекс озарения, который в 2.12 раза выше вдоль оси итераций (рекуррентности), чем вдоль оси глубины. Это подтверждает гипотезу, чтоworkspace-подобные переходы в таких архитектурах проявляются именно через рекуррентные связи.

Кроме того, на модели Pythia-410M был обнаружен фазовый переход с помощью алгоритма PELT на шаге обучения 256. Этот скачок (+67%) произошел задолго до формирования «индукционных голов» (induction heads), что позволяет использовать Ignition Index для раннего обнаружения критических точек в процессе обучения.

Почему масштаб и сила сигнала не сработали

Ожидания, что индекс озарения будет линейно расти с увеличением масштаба модели или силы входного сигнала, не подтвердились. Результаты suggest, что архитектуры трансформеров могут достигать предела насыщения доступных механизмов озарения, после чего дальнейшее масштабирование не приводит к качественному изменению динамики GWT.

Значение для интрпретируемости

Ignition Index становится первым валидированным количественным мостом между динамическими предсказаниями GWT и механистической интерпретируемостью. Он обеспечивает уровень дискриминации на уровне архитектуры, который ранее не характеризовался в литературе по масштабированию моделей.

Источник: arXiv cs.AI ↗