Суть конфликта: теория против реальности
В статье 2022 года Wang et al. был описан «интерпретируемый алгоритм» для задачи Indirect Object Identification (IOI) в GPT-2-small. Согласно этой теории, модель работает как фильтр: Duplicate Token Heads (DTH) находят повторения имен, Subject Inhibition Heads (S-Inhibition) удаляют их из внимания, а Name Mover Heads (NM) выделяют правильный объект. Алгоритм гласит: «Удали все имена, которые встречаются дважды».
Zach Allen проверил этот алгоритм на граничном случае. Если в предложении появляется лишнее имя, которое не является частью структуры IOI, но дублируется случайно, теория предсказывает, что S-Inhibition должен «запутаться» и подавить правильное имя тоже. Однако эксперимент показал обратное: модель сохраняет высокую точность, игнорируя этот «шум».
Методология и цифры
Автор провел серию из 128 парных тестов (matched pairs) на шаблонах вида «Later, John and Mary went to ___ Park. John gave a drink to». В тестовой группе модификатором выступало имя косвенного объекта (например, «Mary Park»), что создавало дубликат имени Mary. В контрольной группе использовалось нейтральное слово (например, «Cedar Park»).
Результаты статистически значимы, но эффект невелик:
- Разница логитов (IO/S): среднее падение составило всего 0.23 (SD 0.84).
- Точность модели: снизилась незначительно с 95.4% (контроль) до 94.5% (тест).
- Статистика: paired t = 3.09, p = 0.0024, Cohen's d = 0.27.
Почему алгоритм «сломался»?
Ключевое наблюдение: Duplicate Token Heads действительно срабатывают на случайное имя Mary (уровень внимания ~0.53–0.57, как и на настоящий дубликат John). Однако S-Inhibition heads не удаляют это имя. Они продолжают фокусироваться на слоте S2 (втором субъекте), а не на случайном дубликате.
Это доказывает, что факт обнаружения дубликата (DTH) сам по себе недостаточен для его подавления. Механизм S-Inhibition работает на основе более сложных условий, чем просто «наличие повтора».
Детали работы заголовков (Heads)
Анализ внимания отдельных заголовков выявил нюансы, которые не учитывались в первоначальной модели:
| Тип заголовка | Поведение при наличии случайного дубликата | Влияние на результат |
|---|---|---|
| Duplicate Token Heads (DTH) | Активно реагируют на случайное имя (attention ~0.53-0.57) | Фиксируют факт дублирования, но не принимают решение о подавлении. |
| Subject Inhibition Heads (S-Inhibition) | Игнорируют случайный дубликат, сохраняя фокус на S2 | Сохраняют точность модели, не «отключая» правильное имя. |
| Name Mover Heads (NM) | Положительные NM игнорируют шум; Отрицательные NM смещаются к дубликату | Положительные NM все еще направляют внимание на правильный IO. Отрицательные NM ведут себя аномально, но не критично. |
Значение для интерпретируемости ИИ
Это исследование ставит под сомнение упрощенное понимание «циркуитов» в нейросетях. То, что мы видим в активациях (DTH срабатывают), не всегда означает, что это приводит к ожидаемому поведению (подавлению токена). Для полного понимания работы GPT-2-small требуется не только декомпозиция на заголовки, но и анализ того, как именно S-Inhibition принимает решение, какое именно дублирование считать «важным». Автор планирует провести ablation-тесты, чтобы точно определить, что именно активирует S-Inhibition в этих условиях.
Источник: LessWrong ↗
