Суть эксперимента: от корреляции к причинности
Автор исследования, используя методы механистической интерпретируемости (Mechanistic Interpretability), проанализировал внутреннюю работу шахматного бота Maia 3. В отличие от Stockfish, Maia 3 обучена имитировать человеческий стиль игры, а не играть оптимально. Цель работы — найти конкретный слой нейросети, где тактика «вилка конем» (knight fork) впервые становится «декодируемой» (decodable) для модели.
Для чистоты эксперимента были отобраны позиции, где конь атакует только короля и ферзя, не подвергаясь немедленной угрозе взятия. Исследование использовало технику Logit Lens: данные из остаточного потока (residual stream) на каждом слое прогонялись через финальный слой декодирования, чтобы увидеть, как меняется распределение вероятностей ходов на глубине сети.
Ключевая метрика: момент «щелчка»
Анализ 500 примеров вилок показал четкую траекторию роста логита (logit) для правильного хода. Критическим порогом, после которого модель начинает уверенно «видеть» тактику, было выбрано значение +2.5. Результаты показали, что для большинства позиций этот порог пересекается на этапе postattn_05 — сразу после слоя внимания (attention layer) в 5-м блоке трансформера.
| Этап обработки | Слой / Точка чтения | Наблюдаемое поведение логита вилки |
|---|---|---|
| Встраивание (Embedding) | embed_in | Низкие значения, тактика не распознается |
| Ранние слои | postattn_01 - postattn_04 | Медленный рост, возможны ранние выбросы |
| Критический момент | postattn_05 (Block 5 Attention) | Резкий скачок (snap) выше порога +2.5 |
| Последующие слои | postattn_06 - postattn_07 | Дальнейшее усиление логита (особенно в Block 7) |
Почему это важно для архитектуры
Результат логичен с точки зрения архитектуры трансформера: слои внимания (Attention) — это единственные места, где информация перемещается между разными клетками доски. Поскольку вилка является реляционной тактикой (зависит от позиций двух фигур относительно коня), она должна обрабатываться именно в слоях внимания, а не в MLP-слоях, которые работают с каждой клеткой изолированно.
Исследователь также отметил наличие early-firing forks — случаев, когда вилка распознавалась уже на 1-м слое (postattn_01). Это открывает путь к изучению того, как «ручка навыка» (skill knob) модели влияет на спarsity (разреженность) и раннее формирование тактических паттернов.
Доступ к инструментам
Автор опубликовал интерактивное приложение и репозиторий с кодом, позволяющие визуализировать эволюцию остаточного потока и работу отдельных голов внимания для любой позиции. Это дает исследователям возможность самостоятельно проверять гипотезы о работе внутренних представлений нейросетей в домене шахмат.
Источник: LessWrong ↗
