Исследования23 июля 2026 г., 11:18 МСК🤖 Auto

AdaRoPE: Адаптивная RoPE для длинных контекстов

Исследователи представили AdaRoPE — метод, который отказывается от единой частоты для всех атомов внимания, улучшая работу LLM с длинным контекстом.

Баннер новости 4192

Проблема стандартной RoPE

Позиционное кодирование Rotary Position Embedding (RoPE) стало стандартом де-факто в современных трансформерах. Однако традиционные реализации используют единый график частот и масштабирования для всех атомов внимания (attention heads). Авторы исследования показывают, что такой подход неэффективен: разные атомы выполняют разные функции и требуют различных диапазонов частот для оптимальной работы. Игнорирование этой структуры приводит к субоптимальному использованию размерности вложений и снижению производительности, особенно в сценариях с длинным контекстом.

Суть AdaRoPE

Предложенный метод AdaRoPE (Adaptive RoPE) наделяет каждый атом внимания обучаемыми частотами вращения и факторами масштабирования внимания. Это позволяет модели гибко настраивать позиционное кодирование под специфические задачи каждого атома. Исследование подтверждает, что адаптивный подход превосходит существующие варианты RoPE, включая Partial RoPE и NoPE, как в задачах извлечения информации, так и в обобщении длины контекста.

Сравнение с YaRN и другими методами

Особое внимание уделено продлению контекста. Стандартные методы, такие как YaRN, используют равномерное масштабирование частот, что авторы AdaRoPE называют субоптимальным. Адаптивное масштабирование на уровне отдельных атомов позволяет лучше сохранять производительность на коротких контекстах при одновременном улучшении экстраполяции на длинных.

Метод Подход к масштабированию Результат на длинных контекстах
Standard RoPE Единая частота для всех атомов Снижение производительности
YaRN Равномерное масштабирование Субоптимальное обобщение
AdaRoPE Адаптивное для каждого атома Лучшая экстраполяция и сохранение качества

Значение для индустрии

Работа принята к публикации на конференции ICML 2026. Результаты подчеркивают важность оптимизации позиционных вложений на уровне отдельных атомов внимания. Для разработчиков LLM это означает возможность создания более эффективных моделей, способных работать с огромными объемами текста без потери точности, что критически важно для RAG-систем и анализа больших документов.

Источник: arXiv cs.AI ↗