Исследования17 августа 2026 г., 21:18 МСК🤖 Auto

Maia-3: Голова l5h5 — не детектор вилки, а «аудитор» коней

Исследование интерпретируемости модели Maia-3 опровергло гипотезу о наличии специализированного «детектора вилок». Выяснилось, что голова l5h5 оценивает угрозы и жестко подавляет бессмысленные ходы конем.

Баннер новости 5941

От «детектора вилок» к «аудитору»

В рамках серии исследований механистической интерпретируемости шахматной модели Maia-3 (архитектура Chessformer) команда dl27 проанализировала поведение головы l5h5 (5-й слой, 5-я голова внимания). Изначально каузальный анализ показал, что эта голова критически важна для распознавания вилок конем: при аблиации (отключении) головы логиты для вилок падали на -2.78, тогда как другие головы меняли значения не более чем на 0.14.

Однако дополнительные зонды разрушили первоначальную гипотезу. Оказалось, что l5h5 не является универсальным детектором тактических комбинаций. При тестировании вилок пешкой (N=250) изменение логита составило всего +0.10, что статистически незначимо. Голова специфична именно для коней и оценивает не сам факт атаки, а её качество и целесообразность.

Градиент угрозы: от поддержки к подавлению

Анализ «пустых» атак конем (hollow attacks), не создающих реальных проблем сопернику, выявил четкий градиент реакции модели. Голова l5h5 действует как фильтр: она поддерживает ходы с реальной угрозой и подавляет ходы, атакующие слишком ценные фигуры без возможности их захвата.

Тип атаки конем Среднее изменение логита (Δ) Стандартная ошибка (SEM) Интерпретация
Атака короля/ферзя (вилка K+Q) -2.01 Максимальная поддержка (сильная угроза)
Атака ферзя (без вилки) -1.13 Поддержка (реальная угроза)
Атака ферзя (пустая) +0.56 ± 0.03 Подавление (бесполезная атака)
Атака ладьи (пустая) +0.13 ± 0.02 Слабое подавление
Атака слона (пустая) -0.01 ± 0.02 Нейтрально
Атака пешки (пустая) -0.11 ± 0.03 Слабая поддержка

Примечание: знак «+» означает подавление (абляция улучшает логит), знак «-» означает поддержку (абляция ухудшает логит). Разница между соседними категориями составляет ≥2.8 SEM, что указывает на статистическую значимость.

Главный инсайт: борьба с «бессмысленностью»

Самым важным открытием стало поведение головы при оценке «тихих» ходов конем. Исследователи разделили ходы на категории: «хорошие» (топ-1 политика модели), «плохие» (низкий рейтинг движка) и «тихие» (не создающие новых атак).

Голова l5h5 демонстрирует асимметричное поведение:

  • Поддержка хороших ходов: Δ = -0.30 ± 0.03
  • Подавление плохих атак: Δ = -0.67 ± 0.04
  • Подавление «бессмысленных» ходов (плохие + тихие): Δ = +0.78 ± 0.06

Голова подавляет «бессмысленные» ходы конем (например, лишний перевод фигуры из центра) в 2.93 раза сильнее, чем плохие атакующие ходы. Это свидетельствует о том, что нейросеть внутренне кодирует стратегическую ценность позиции, отсеивая ходы, которые не несут тактической или стратегической нагрузки, даже если они формально легальны.

Значение для AI и когнитивистики

Результаты показывают, что Maia-3, обученная имитировать игру людей уровня 2400 ELO, не просто запоминает тактические паттерны. Её внутренняя онтология структурирована вокруг оценки «качества» угроз. Голова l5h5 работает как «аудитор», который:

  1. Изолирует действия коня.
  2. Масштабирует поддержку в зависимости от ценности реальной угрозы.
  3. Жестко карает за тактическую пустоту (pointless moves).

Это перекликается с когнитивными исследованиями, где сильные игроки быстро отбрасывают ходы, лишенные стратегического смысла, опираясь на интуитивное понимание позиции, а не только на расчет вариантов.

Источник: LessWrong ↗