Суть эксперимента: поиск «головы копирования»
Автор обучила небольшой символьный трансформер (6 блоков, 4 головы внимания в каждом) на текстах Фридриха Ницше. Цель — найти и расшифровать конкретный механизм внимания, используя метод собственных значений (eigenvalue method) из работы Elhage et al. Ключевой метрикой стал copying score (коэффициент копирования), рассчитанный как сумма действительных частей собственных значений матрицы OV, деленная на сумму их модулей.
Результаты оказались однозначными: одна голова выделяется на фоне остальных. Она не просто копирует токены, но и демонстрирует специфическое поведение с пунктуацией, что привело к серии гипотез о «грамматике кавычек» и «грамматике скобок».
Ключевые метрики и результаты
Анализ показал, что голова B5H0 (5-й блок, 0-я голова) является единственным кандидатом на роль «головы копирования». Ниже приведены сравнительные данные по всем 24 головам модели:
| Параметр | Значение / Описание |
|---|---|
| Идентификатор головы | B5H0 (Block 5, Head 0) |
| Copying Score | 0.615 (резкий пик, у следующей головы — 0.35) |
| Логит для кавычек (" | 0.594 (наивысший среди всех токенов) |
| Логит для «(» | 0.556 (увеличивает логит для «)») |
| Логит для «)» | Отрицательный (подавляет закрытие скобок) |
| Тип механизма | Induction Head (Голова индукции) с частичным знанием грамматики |
Гипотеза 1: Грамматика кавычек (опровергнута)
Высокий логит для кавычек (0.594) наводит на мысль, что голова знает правило: кавычка должна открываться и закрываться. Однако анализ паттернов внимания QK-контура показал обратное. Голова не ищет пару для кавычки, а работает как классическая induction head: она обращает внимание на токен, который следовал за предыдущим вхождением текущего токена. Это механизм подражания контексту, а не понимания синтаксиса цитирования.
Гипотеза 2: Грамматика скобок (частично подтверждена, частично опровергнута)
Матрица OV (Output-Value) демонстрирует четкую логику: при виде открывающей скобки ( голова повышает логит для закрывающей ) (значение 0.556). Это выглядит как знание правила балансировки скобок. Однако QK-контур (Query-Key), отвечающий за выбор, на что обратить внимание, «слеп» к структуре. Голова просто следит за последней встреченной скобкой, не различая вложенность или необходимость закрытия. В тестах она проигрывала открытым скобкам уже закрытые, если те встречались позже.
Главный вывод: «Половинчатый» механизм
Итоговое заключение исследователя: B5H0 — это голова-индуктор, которая «знает» грамматику скобок на уровне весов (OV-контур), но не может применить это знание, так как QK-контур не маршрутизирует внимание к нужным позициям для проверки глубины вложенности. Это редкий случай, когда механизм в нейросети находится в состоянии «half-built» — часть функционала реализована, но функционально инертна из-за отсутствия связующего звена.
Источник: LessWrong ↗
