Исследования7 июля 2026 г., 09:20 МСК🤖 Auto

Как нейросеть «видит» шахматную вилку: разбор архитектуры Maia 3

Исследование механистической интерпретируемости модели Maia 3 выявило, что тактика «вилка конем» становится детектируемой на 5-м слое трансформера, что подтверждает гипотезы о раннем формировании тактических представлений.

Баннер новости 3011

Суть эксперимента: от корреляции к причинности

Автор исследования, используя методы механистической интерпретируемости (Mechanistic Interpretability), проанализировал внутреннюю работу шахматного бота Maia 3. В отличие от Stockfish, Maia 3 обучена имитировать человеческий стиль игры, а не играть оптимально. Цель работы — найти конкретный слой нейросети, где тактика «вилка конем» (knight fork) впервые становится «декодируемой» (decodable) для модели.

Для чистоты эксперимента были отобраны позиции, где конь атакует только короля и ферзя, не подвергаясь немедленной угрозе взятия. Исследование использовало технику Logit Lens: данные из остаточного потока (residual stream) на каждом слое прогонялись через финальный слой декодирования, чтобы увидеть, как меняется распределение вероятностей ходов на глубине сети.

Ключевая метрика: момент «щелчка»

Анализ 500 примеров вилок показал четкую траекторию роста логита (logit) для правильного хода. Критическим порогом, после которого модель начинает уверенно «видеть» тактику, было выбрано значение +2.5. Результаты показали, что для большинства позиций этот порог пересекается на этапе postattn_05 — сразу после слоя внимания (attention layer) в 5-м блоке трансформера.

Этап обработки Слой / Точка чтения Наблюдаемое поведение логита вилки
Встраивание (Embedding) embed_in Низкие значения, тактика не распознается
Ранние слои postattn_01 - postattn_04 Медленный рост, возможны ранние выбросы
Критический момент postattn_05 (Block 5 Attention) Резкий скачок (snap) выше порога +2.5
Последующие слои postattn_06 - postattn_07 Дальнейшее усиление логита (особенно в Block 7)

Почему это важно для архитектуры

Результат логичен с точки зрения архитектуры трансформера: слои внимания (Attention) — это единственные места, где информация перемещается между разными клетками доски. Поскольку вилка является реляционной тактикой (зависит от позиций двух фигур относительно коня), она должна обрабатываться именно в слоях внимания, а не в MLP-слоях, которые работают с каждой клеткой изолированно.

Исследователь также отметил наличие early-firing forks — случаев, когда вилка распознавалась уже на 1-м слое (postattn_01). Это открывает путь к изучению того, как «ручка навыка» (skill knob) модели влияет на спarsity (разреженность) и раннее формирование тактических паттернов.

Доступ к инструментам

Автор опубликовал интерактивное приложение и репозиторий с кодом, позволяющие визуализировать эволюцию остаточного потока и работу отдельных голов внимания для любой позиции. Это дает исследователям возможность самостоятельно проверять гипотезы о работе внутренних представлений нейросетей в домене шахмат.

Источник: LessWrong ↗