Исследования25 сентября 2026 г., 05:18 МСК🤖 Auto

Глубина мышления: как рост Elo перемещает вычисления в слоях Transformer

Исследование Дэвида Литмана показало, что в замороженной модели шахматного Transformer Maia-3 повышение уровня игры (Elo) с 700 до 2500 монотонно сдвигает центр масс вычислений в более глубокие слои.

Баннер новости 8228

Парадокс «миграции глубины»

Традиционное представление о работе нейросетей предполагает, что сложные признаки должны извлекаться на ранних этапах, чтобы быть использованными в последующих слоях. Однако анализ архитектуры Maia-3 (8 слоев, 16 голов на слой) опроверг эту гипотезу. При увеличении входного параметра Elo от 700 до 2500, «центр масс каузальности» (Causal Center of Mass) для всех типов фигур и ходов смещается вглубь сети. Это означает, что чем сильнее играет модель, тем больше она полагается на поздние слои для специализированных вычислений, в то время как вклад ранних слоев остается относительно стабильным.

Методология: Ablation Sweep

Исследование использовало библиотеку chessformer-lens для проведения «свипов аблиации» (head ablation sweeps). Для каждого из 500 позиций с вилкой (fork) по каждому типу фигуры (кроме короля и ферзя) измерялось изменение логита хода при отключении каждой из 128 голов. Разница в логите после аблиации служила мерой «каузальной массы» головы. Статистическая значимость подтверждена перестановочным тестом (p < 0.001).

Ключевые метрики: Влияние Elo на глубину

Сдвиг вычислений в более глубокие слои наблюдается монотонно для всех фигур. Наибольшее изменение зафиксировано для коней, что связано со сложностью тактики вилки конем. Ниже приведены данные по изменению центра масс (ΔCOM) при переходе от Elo 700 к Elo 2500:

Фигура Общее изменение ΔCOM (слои) Сдвиг на шаг Elo Стат. значимость (p-value)
Пешка +0.519 0.519 ± 0.040 < 0.001
Слон +0.547 0.547 ± 0.040 < 0.001
Конь +0.880 0.880 ± 0.028 < 0.001
Ладья +0.522 0.522 ± 0.041 < 0.001

Тактика против «тихих» ходов

Интересно, что миграция глубины не ограничивается тактическими комбинациями. Даже «тихие» ходы (quiet moves) и явные ошибки (blunders) требуют все более глубоких слоев по мере роста Elo. Это указывает на то, что высокоуровневая игра требует глобального перераспределения вычислительных ресурсов вглубь сети, а не только локальной оптимизации тактики.

Структура миграции в задачах

Анализ шахматных головоломок показал, что некоторые тактические паттерны вызывают избыточное смещение глубины по сравнению с лучшим альтернативным ходом в той же позиции. Например, «вилка конем» (my royal knight fork) демонстрирует избыточное смещение +0.513, тогда как мат в 3 хода — лишь +0.115. Жертва фигуры (sacrifice) статистически не отличается от нуля, что может указывать на то, что модель обрабатывает жертвы через другие механизмы или на других глубинах.

Источник: LessWrong ↗