Исследования3 октября 2026 г., 05:22 МСК🤖 Auto

RoPE против NoPE: как позиционное кодирование ломает контекст LLM

Исследование arXiv:2609.38530 показывает, что гибридные архитектуры (SWA NoPE) жертвуют точностью поиска ключей ради семантики, что критично для RAG-систем.

Баннер новости 8835

Суть проблемы: скрытый компромисс длинного контекста

Новое исследование авторов Eric Enouen и Sainyam Galhotra вскрывает фундаментальную проблему современных LLM. Архитектуры, комбинирующие скользящее окно внимания (Sliding-Window Attention, SWA) с глобальным вниманием без позиционного кодирования (NoPE) в дальних слоях, демонстрируют рост метрик длинного контекста. Однако за этим «улучшением» скрывается сдвиг механизмов: модель переходит от точного позиционного поиска к семантическому угадыванию, что критично для задач, требующих точного извлечения данных.

Масштаб анализа: 22 модели, 8 семейств

Авторы провели механистический анализ, отследив внутренние механизмы извлечения информации (in-context retrieval) в 22 открытых моделях. Исследование охватило восемь различных семейств архитектур. Ключевое наблюдение: стандартные модели с RoPE (Rotary Position Embeddings) полагаются на позиционное извлечение (где находится информация), тогда как гибридные модели с NoPE смещаются в сторону семантического извлечения (о чем информация).

Эксперимент с абляцией: причина сдвига

Контролируемое предобучение (pre-training ablation) показало, что ограничение позиционного кодирования только локальными слоями приводит к деградации представлений позиционной информации. Именно это техническое решение, часто используемое для оптимизации вычислений, заставляет модель «забывать» точные координаты токенов в пользу их смыслового сходства.

Результаты бенчмарков: где NoPE проигрывает

Хотя гибридные архитектуры (SWA NoPE) превосходят RoPE в задачах на множественные цели (multiple-target retrieval) и общем QA, они демонстрируют существенный спад производительности в задачах, требующих различения конкурирующих ключей. Ниже приведено сравнение поведения моделей в зависимости от типа позиционного кодирования:

Характеристика Стандартная RoPE Гибрид (SWA NoPE)
Основной механизм Позиционное извлечение Семантическое извлечение
Точность поиска ключей Высокая (четкое разделение) Снижена (конфликт семантики)
Множественный поиск (Multiple-target) Базовый уровень Улучшенный
Качество QA Стабильное Улучшенное (за счет семантики)
Риск галлюцинаций Ниже (опора на позицию) Выше (опора на смысл)

Почему это важно для индустрии

Для разработчиков RAG-систем и инженеров, работающих с длинными документами, этот вывод означает, что «более длинный контекст» не всегда означает «более точное извлечение фактов». Если ваша задача требует точного цитирования или поиска конкретных сущностей в большом тексте, модели с гибридным позиционным кодированием могут ошибаться, путая похожие по смыслу, но разные по положению фрагменты. Выбор архитектуры должен диктоваться не только длиной контекста, но и типом требуемой точности.

Источник: arXiv cs.CL ↗