Исследования7 августа 2026 г., 05:18 МСК🤖 Auto

Больше — значит меньше: как позиция влияет на повторения в LLM

Исследование arXiv:2608.04021 доказывает, что в языковых моделях повторение токенов работает нелинейно. В отличие от классического прайминга, отдаленные повторы снижают вероятность предсказания целевого слова.

Баннер новости 5267

Разрушение мифа о линейном прайминге

Традиционные cloze-зонды (Cloze-style probes) предполагали, что количество копий целевого токена влияет на предсказание модели одинаково, независимо от того, где находится слот для чтения (readout slot). Исследователь Ханью Ван (Han-yu Wang) опроверг это допущение, показав, что позиция критически важна. Введение дополнительных копий слова не всегда усиливает сигнал; в некоторых случаях оно его подавляет.

Два сценария: «Близко» против «Далеко»

Авторы использовали двухзондовый дизайн, фиксируя префикс с повторами и меняя только позицию целевого токена. Результаты кардинально различаются:

  • Соседнее повторение (Adjacent): Работает как классический прайминг. Вероятность $P(\text{target})$ растет с увеличением числа копий $N$ и выходит на плато. Модель «запоминает» слово, так как оно находится в непосредственной близости.
  • Отдаленное повторение (Displaced): Наблюдается эффект «перевернутой U-образной кривой» (inverted-U). Вероятность предсказания сначала растет, достигает раннего пика, а затем снижается по мере добавления новых копий. Это означает, что избыточность начинает мешать, а не помогать.

Масштаб и статистическая значимость

Эффект отдаленного снижения вероятности (inverted-U) не является артефактом. Он зафиксирован в 42 из 42 мультиязычных тестовых ячейках, включая испанский, китайский, немецкий и французский языки. В 13 открытых моделях (как энкодерах, так и декодерах) падение вероятности на слово имеет доверительный интервал, исключающий ноль (bootstrap CI excluding zero), что подтверждает причинно-следственную связь.

Внутренняя механика: куда смотрит внимание?

Абляционное исследование (causal ablation) из шести условий показало, что эффект вызван именно лексическим повторением, а не просто длиной текста или семантической близостью. Анализ механизмов внимания (attention) выявил парадокс:

  • В причинных языковых моделях (causal LMs) внимание на каждый отдельный токен-цель падает с ростом $N$, хотя общий бюджет внимания на блок повторений растет.
  • В моделях с маскированным вниманием (masked LM) такой рост общего бюджета не наблюдается.

Почему это важно для разработчиков

Результаты показывают, что при оценке способностей моделей к запоминанию или контекстному пониманию нельзя считать позицию токена ортогональной (независимой) от измеряемого свойства. Простое увеличение количества упоминаний сущности в промпте может ухудшить качество ответа модели, если эти упоминания разбросаны по тексту, а не сгруппированы. Это требует пересмотра стратегий построения контекстных окон и промпт-инжиниринга для сложных задач.

Источник: arXiv cs.CL ↗