Парадокс «миграции глубины»
Традиционное представление о работе нейросетей предполагает, что сложные признаки должны извлекаться на ранних этапах, чтобы быть использованными в последующих слоях. Однако анализ архитектуры Maia-3 (8 слоев, 16 голов на слой) опроверг эту гипотезу. При увеличении входного параметра Elo от 700 до 2500, «центр масс каузальности» (Causal Center of Mass) для всех типов фигур и ходов смещается вглубь сети. Это означает, что чем сильнее играет модель, тем больше она полагается на поздние слои для специализированных вычислений, в то время как вклад ранних слоев остается относительно стабильным.
Методология: Ablation Sweep
Исследование использовало библиотеку chessformer-lens для проведения «свипов аблиации» (head ablation sweeps). Для каждого из 500 позиций с вилкой (fork) по каждому типу фигуры (кроме короля и ферзя) измерялось изменение логита хода при отключении каждой из 128 голов. Разница в логите после аблиации служила мерой «каузальной массы» головы. Статистическая значимость подтверждена перестановочным тестом (p < 0.001).
Ключевые метрики: Влияние Elo на глубину
Сдвиг вычислений в более глубокие слои наблюдается монотонно для всех фигур. Наибольшее изменение зафиксировано для коней, что связано со сложностью тактики вилки конем. Ниже приведены данные по изменению центра масс (ΔCOM) при переходе от Elo 700 к Elo 2500:
| Фигура | Общее изменение ΔCOM (слои) | Сдвиг на шаг Elo | Стат. значимость (p-value) |
|---|---|---|---|
| Пешка | +0.519 | 0.519 ± 0.040 | < 0.001 |
| Слон | +0.547 | 0.547 ± 0.040 | < 0.001 |
| Конь | +0.880 | 0.880 ± 0.028 | < 0.001 |
| Ладья | +0.522 | 0.522 ± 0.041 | < 0.001 |
Тактика против «тихих» ходов
Интересно, что миграция глубины не ограничивается тактическими комбинациями. Даже «тихие» ходы (quiet moves) и явные ошибки (blunders) требуют все более глубоких слоев по мере роста Elo. Это указывает на то, что высокоуровневая игра требует глобального перераспределения вычислительных ресурсов вглубь сети, а не только локальной оптимизации тактики.
Структура миграции в задачах
Анализ шахматных головоломок показал, что некоторые тактические паттерны вызывают избыточное смещение глубины по сравнению с лучшим альтернативным ходом в той же позиции. Например, «вилка конем» (my royal knight fork) демонстрирует избыточное смещение +0.513, тогда как мат в 3 хода — лишь +0.115. Жертва фигуры (sacrifice) статистически не отличается от нуля, что может указывать на то, что модель обрабатывает жертвы через другие механизмы или на других глубинах.
Источник: LessWrong ↗
