Локализация тактики в одном нейроне
Исследователи из сообщества LessWrong представили новую библиотеку chessformer_lens, предназначенную для механистической интерпретируемости нейросетей, обученных на шахматах. Главная находка: с помощью методов logit-lens и per-head ablation удалось доказать, что одна конкретная голова механизма внимания (attention head) в модели Maia-3 несет ответственность за распознавание и выполнение вилки конем (knight fork).
Это не просто корреляция, а причинно-следственная связь. Исследование показывает, что архитектура модели выделяет специфические паттерны внимания для сложных тактических элементов, что открывает путь к пониманию того, как LLM «думают» в стратегических играх.
Количественные метрики и результаты
Для подтверждения гипотезы была проведена серия аблиционных экспериментов. Удаление (ablation) работы целевой головы привело к катастрофическому падению вероятности правильного хода, в то время как удаление других голов в том же слое практически не влияло на результат. Ниже приведены ключевые метрики эффективности одного внимания:
| Параметр | Значение / Описание |
|---|---|
| Модель | Maia-3 (шахматный трансформер) |
| Ключевой механизм | Один attention head (выявлен через logit-lens) |
| Влияние аблиции целевой головы | Потеря 2.78 logits (критическое снижение качества) |
| Влияние аблиции других голов | Потеря ≤ 0.14 logits (статистически незначимо) |
| Пример позиции | FEN: 4kb1r/p2n1ppp/4q3/4p1B1/4P3/1Q6/PPP2PPP/2KR4 w k - 0 16 |
Инструментарий Chessformer_lens
Библиотека создана как ответ на отсутствие общей инфраструктуры для интерпретируемости шахматных моделей. Она вдохновлена популярной библиотекой transformer_lens от Neel Nanda, но адаптирована под специфику шахмат, где один токен соответствует одной клетке доски. Это позволяет визуализировать паттерны внимания в виде понятных шахматных диаграмм.
Архитектура библиотеки включает:
- Engine Core: Ядро для работы с моделями, хуками, GAB-декомпозицией и анализом residual stream.
- Interactive App: Визуальное приложение для тестирования гипотез в реальном времени.
- Notebook Widgets: Интерактивные виджеты для Jupyter-ноутбуков, позволяющие исследователям генерировать гипотезы «на лету».
Как это работает на практике
Разработчик демонстрирует возможность интерактивного анализа через Colab-блокноты. Пользователь может загрузить позицию, запустить модель и с помощью инструмента move microscope и кнопки аблиции определить, какой именно слой или голова отвечает за «потрясающую жертву ферзя» в конкретной партии. Это делает процесс интерпретируемости доступным не только для экспертов, но и для широкого круга исследователей AI.
Библиотека уже доступна для установки через pip (pip install "chessformer_lens[all]"), а полная научная статья с углубленным анализом сотен тактических комбинаций находится в стадии подготовки.
Источник: LessWrong ↗
