Разрушение мифа о линейном прайминге
Традиционные cloze-зонды (Cloze-style probes) предполагали, что количество копий целевого токена влияет на предсказание модели одинаково, независимо от того, где находится слот для чтения (readout slot). Исследователь Ханью Ван (Han-yu Wang) опроверг это допущение, показав, что позиция критически важна. Введение дополнительных копий слова не всегда усиливает сигнал; в некоторых случаях оно его подавляет.
Два сценария: «Близко» против «Далеко»
Авторы использовали двухзондовый дизайн, фиксируя префикс с повторами и меняя только позицию целевого токена. Результаты кардинально различаются:
- Соседнее повторение (Adjacent): Работает как классический прайминг. Вероятность $P(\text{target})$ растет с увеличением числа копий $N$ и выходит на плато. Модель «запоминает» слово, так как оно находится в непосредственной близости.
- Отдаленное повторение (Displaced): Наблюдается эффект «перевернутой U-образной кривой» (inverted-U). Вероятность предсказания сначала растет, достигает раннего пика, а затем снижается по мере добавления новых копий. Это означает, что избыточность начинает мешать, а не помогать.
Масштаб и статистическая значимость
Эффект отдаленного снижения вероятности (inverted-U) не является артефактом. Он зафиксирован в 42 из 42 мультиязычных тестовых ячейках, включая испанский, китайский, немецкий и французский языки. В 13 открытых моделях (как энкодерах, так и декодерах) падение вероятности на слово имеет доверительный интервал, исключающий ноль (bootstrap CI excluding zero), что подтверждает причинно-следственную связь.
Внутренняя механика: куда смотрит внимание?
Абляционное исследование (causal ablation) из шести условий показало, что эффект вызван именно лексическим повторением, а не просто длиной текста или семантической близостью. Анализ механизмов внимания (attention) выявил парадокс:
- В причинных языковых моделях (causal LMs) внимание на каждый отдельный токен-цель падает с ростом $N$, хотя общий бюджет внимания на блок повторений растет.
- В моделях с маскированным вниманием (masked LM) такой рост общего бюджета не наблюдается.
Почему это важно для разработчиков
Результаты показывают, что при оценке способностей моделей к запоминанию или контекстному пониманию нельзя считать позицию токена ортогональной (независимой) от измеряемого свойства. Простое увеличение количества упоминаний сущности в промпте может ухудшить качество ответа модели, если эти упоминания разбросаны по тексту, а не сгруппированы. Это требует пересмотра стратегий построения контекстных окон и промпт-инжиниринга для сложных задач.
Источник: arXiv cs.CL ↗
