Исследования19 августа 2026 г., 03:17 МСК🤖 Auto

GPT-2 игнорирует алгоритм IOI: почему модель не удаляет дубликаты имен

Исследование Zach Allen показывает, что GPT-2-small успешно решает задачу косвенного объекта, даже когда механизм подавления субъекта (S-Inhibition) сталкивается с непредвиденными дубликатами имен, которые, согласно теории, должны были сломать логику

Баннер новости 6034

Суть конфликта: теория против реальности

В статье 2022 года Wang et al. был описан «интерпретируемый алгоритм» для задачи Indirect Object Identification (IOI) в GPT-2-small. Согласно этой теории, модель работает как фильтр: Duplicate Token Heads (DTH) находят повторения имен, Subject Inhibition Heads (S-Inhibition) удаляют их из внимания, а Name Mover Heads (NM) выделяют правильный объект. Алгоритм гласит: «Удали все имена, которые встречаются дважды».

Zach Allen проверил этот алгоритм на граничном случае. Если в предложении появляется лишнее имя, которое не является частью структуры IOI, но дублируется случайно, теория предсказывает, что S-Inhibition должен «запутаться» и подавить правильное имя тоже. Однако эксперимент показал обратное: модель сохраняет высокую точность, игнорируя этот «шум».

Методология и цифры

Автор провел серию из 128 парных тестов (matched pairs) на шаблонах вида «Later, John and Mary went to ___ Park. John gave a drink to». В тестовой группе модификатором выступало имя косвенного объекта (например, «Mary Park»), что создавало дубликат имени Mary. В контрольной группе использовалось нейтральное слово (например, «Cedar Park»).

Результаты статистически значимы, но эффект невелик:

  • Разница логитов (IO/S): среднее падение составило всего 0.23 (SD 0.84).
  • Точность модели: снизилась незначительно с 95.4% (контроль) до 94.5% (тест).
  • Статистика: paired t = 3.09, p = 0.0024, Cohen's d = 0.27.

Почему алгоритм «сломался»?

Ключевое наблюдение: Duplicate Token Heads действительно срабатывают на случайное имя Mary (уровень внимания ~0.53–0.57, как и на настоящий дубликат John). Однако S-Inhibition heads не удаляют это имя. Они продолжают фокусироваться на слоте S2 (втором субъекте), а не на случайном дубликате.

Это доказывает, что факт обнаружения дубликата (DTH) сам по себе недостаточен для его подавления. Механизм S-Inhibition работает на основе более сложных условий, чем просто «наличие повтора».

Детали работы заголовков (Heads)

Анализ внимания отдельных заголовков выявил нюансы, которые не учитывались в первоначальной модели:

Тип заголовка Поведение при наличии случайного дубликата Влияние на результат
Duplicate Token Heads (DTH) Активно реагируют на случайное имя (attention ~0.53-0.57) Фиксируют факт дублирования, но не принимают решение о подавлении.
Subject Inhibition Heads (S-Inhibition) Игнорируют случайный дубликат, сохраняя фокус на S2 Сохраняют точность модели, не «отключая» правильное имя.
Name Mover Heads (NM) Положительные NM игнорируют шум; Отрицательные NM смещаются к дубликату Положительные NM все еще направляют внимание на правильный IO. Отрицательные NM ведут себя аномально, но не критично.

Значение для интерпретируемости ИИ

Это исследование ставит под сомнение упрощенное понимание «циркуитов» в нейросетях. То, что мы видим в активациях (DTH срабатывают), не всегда означает, что это приводит к ожидаемому поведению (подавлению токена). Для полного понимания работы GPT-2-small требуется не только декомпозиция на заголовки, но и анализ того, как именно S-Inhibition принимает решение, какое именно дублирование считать «важным». Автор планирует провести ablation-тесты, чтобы точно определить, что именно активирует S-Inhibition в этих условиях.

Источник: LessWrong ↗