Исследования21 августа 2026 г., 01:20 МСК🤖 Auto

Один нейрон: как отключение 1 из 128 голов сломало шахматный ИИ

Исследование показывает, что удаление всего одного механизма внимания в трансформере для шахмат полностью лишает модель способности находить знаменитый жертвенный ход королевы Поля Морфи.

Баннер новости 6197

Суть эксперимента: точечное отключение

Исследователь dl27 провел серию экспериментов с нейросетью, обученной играть в шахматы. Модель использует архитектуру трансформера с 128 головами внимания (attention heads). Целью было понять, как именно модель обрабатывает сложные тактические комбинации, в частности, знаменитую жертву ферзя, совершенную в партии Поля Морфи против графа Исидора Кизериски (1858).

В ходе анализа было выявлено, что одна конкретная голова внимания играет критическую роль в распознавании этой комбинации. Когда исследователи аблятировали (отключили) именно эту одну голову из 128, модель переставала видеть возможность жертвы ферзя, выбирая менее агрессивные, но менее эффективные ходы.

Почему это важно для интерпретируемости ИИ

Этот случай демонстрирует принцип «одного нейрона» (или одной головы внимания) в контексте сложных стратегических задач. Обычно считается, что такие сложные концепции распределены по всей сети. Однако здесь показано, что удаление всего ~0.78% вычислительных ресурсов модели (1/128) приводит к полному провалу в выполнении конкретной тактической задачи.

Это ставит важный вопрос для разработчиков ИИ: насколько устойчивы современные модели к точечным атакам или ошибкам в обучении? Если одна голова «поддерживает» жертву ферзя, то другая, вероятно, подавляет менее вынужденные ходы ферзя, что указывает на высокую специализацию отдельных компонентов архитектуры.

Сравнение поведения модели

Ниже приведена таблица, иллюстрирующая разницу в поведении модели до и после вмешательства:

Состояние модели Количество голов внимания Результат на позиции Морфи Интерпретация
Исходная (Baseline) 128 Находит жертву ферзя Полная тактическая осведомленность
После абляции 127 Не находит жертву Потеря способности к сложной тактике

Выводы для индустрии

Результаты подчеркивают необходимость глубокого анализа внутренних представлений (mechanistic interpretability) в больших языковых и специализированных моделях. Понимание того, какие именно компоненты отвечают за ключевые навыки, позволяет:

  • Повышать надежность систем ИИ в критических задачах.
  • Оптимизировать архитектуру, убирая шум и усиливая значимые связи.
  • Создавать более объяснимые модели, где можно проследить логику принятия решений до уровня отдельных нейронов.

Эксперимент подтверждает, что даже в очень больших моделях сложные концепции могут быть «зашиты» в относительно небольшие подсистемы, что делает их уязвимыми, но и дает ключ к точечному улучшению.

Источник: LessWrong ↗