Суть метода: от высокой размерности к скалярам
Тензорные программы (Tensor Programs) представляют собой математический язык для описания вычислений в широких нейронных сетях. Ключевая идея «теоремы о главном пределе» (Master Theorem) заключается в том, что по мере роста ширины сети средние значения по нейронам становятся предсказуемыми: они сходятся к математическим ожиданиям в гораздо более простом скалярном случайном процессе. Это превращает анализ высокоразмерной случайной сети в разрешимую вероятностную задачу и дает строгое основание для изучения поведения сетей бесконечной ширины, включая пределы гауссовских процессов (Lee et al., 2018) и нейронные касательные ядра (Jacot et al., 2018).
Проблема повторного использования матриц
Основная сложность возникает, когда случайная матрица весов используется повторно, как это происходит при разделении весов (weight sharing) и обратном распространении ошибки (backpropagation). Простая замена каждого произведения матриц на свежий гауссовский шум неверна, так как игнорирует корреляции. Доказательство учитывает это, условно фиксируя все предыдущие использования матрицы и разделяя следующий выход на коррекцию, зависящую от прошлого, и genuinely fresh (действительно новую) гауссовскую часть. Индуктивный метод показывает, что скалярный процесс точно отслеживает полные вычисления, даже если промежуточные векторы линейно зависимы.
Правила скалярного исчисления (α-rules)
Программа начинается со случайных векторов и матриц, применяя нелинейности. Предельный скаляр, связанный с каждым вектором программы, определяется рекурсивно. Ниже приведена структура правил для ключевых операций:
| Операция | Математическая формулировка | Примечание |
|---|---|---|
| Начальные векторы | Для $i=1..d$, использовать компоненту $v_i$ | Базовый уровень рекурсии |
| Попозиционная операция | $\alpha_{f(v)} = f(\alpha_v)$ | Применяется к нелинейностям |
| Произведение матриц | $\alpha_{Wv} = \sqrt{\frac{\alpha_v^2}{n}} \cdot \text{sign}(\text{orient})$ | Учитывает независимость координатных срезов |
| Повторное использование (Transpose) | Коррекция через сумму по предыдущим продуктам | Восстанавливает зависимость через $W^T$ |
Для негладких функций ожидаемые производные определяются через гауссову регрессию. Если $v$ зависит от предыдущих продуктов, вектор коэффициентов регрессии вычисляется так, чтобы сохранить согласованность с тождеством Штейна (Stein's identity).
Устойчивость грамовских матриц и Core-Set
Доказательство опирается на два индуктивных утверждения: инвариантность моментов и инвариантность «Core-Set» (базового множества). Core-Set — это набор векторов, образующих базис для всех предыдущих G-переменных. Ключевое свойство: закон распределения $v$ и мера Лебега имеют одни и те же множества нулевой меры. Это позволяет переводить почти всюду сходящихся пределов в точные тождества для конечной ширины сети.
При обновлении Core-Set рассматриваются два случая:
- Нулевая дисперсия остатка: Если дисперсия равна нулю, новый вектор линейно зависит от старого Core-Set, и базис не меняется.
- Положительная дисперсия остатка: Если дисперсия положительна, новый вектор добавляется к базису. Благодаря гауссовой плотности, это сохраняет свойство избегания множеств нулевой меры (null-avoidance), что критически важно для корректности пределов.
Значение для исследователей
Этот материал предоставляет rigorous foundation (строгое основание) для анализа широких сетей. Вместо симуляции миллионов параметров, исследователи могут использовать скалярное исчисление для предсказания динамики обучения и свойств выхода сети. Это особенно важно для понимания фазы обучения, где градиенты и активации ведут себя детерминированно в пределе, несмотря на стохастическую природу инициализации.
Источник: LessWrong ↗
