Исследования7 августа 2026 г., 22:17 МСК🤖 Auto

RIG-RoPE: Как решить проблему смешения модальностей в LLM

Исследователь Дунгген Ли представил RIG-RoPE — механизм позиционного кодирования, который устраняет пространственные помехи и дисбаланс временных координат в мультимодальных моделях без добавления обучаемых параметров.

Баннер новости 5334

Проблема статических координат в мультимодальных LLM

Современные мультимодальные большие языковые модели (LLM) часто используют многомерные варианты Rotary Positional Encoding (RoPE), такие как M-RoPE, разделяющие каналы позиций на временные, высоту и ширину. Однако в интерлированном (переплетенном) контексте, где текст, изображения и видео идут вперемешку, статическое присвоение позиций создает два критических дефекта:

  • Пространственные помехи: Вращения по высоте/ширине применяются к парам токенов, пространственное смещение между которыми не является геометрически определенным объектом. Это приводит к перекрестным модальным и межэкземплярным пространственным интерференциям.
  • Игнорирование плотности информации: Временные координаты часто обрабатываются как равные шаги. Токен текста, блок изображения и сегмент видео продвигают временную фазу на одинаковую величину, несмотря на колоссальную разницу в информационной плотности.

Решение: RIG-RoPE с учетом длительности

Автор предлагает механизм RIG-RoPE (Relation- and Instance-Gated RoPE), который обогащает каждый токен тремя элементами: индикатором модальности, идентификатором визуального экземпляра и скалярной координатой «информационной длительности». Ключевые особенности:

  • Гейтирование по экземплярам: Вращения по высоте/ширине (H/W) применяются только к парам query-key, принадлежащим одному и тому же визуальному экземпляру. Для остальных пар неизвестное пространственное смещение маргинализируется, а не обнуляется.
  • Временные координаты с учетом длительности: Временные вращения используют интерполированные кумулятивные длительности блоков. Текст потребляет единичную длительность, изображения используют логарифмический пространственный масштаб, зависящий от размерности, а видео добавляют логарифмическое временное расширение по эффективным кадрам.

Технические преимущества и метрики

Метод RIG-RoPE не требует добавления обучаемых параметров (learned parameters) и может быть реализован внутри ядра внимания с разделением на тайлы (tiled attention kernels) с постоянными дополнительными метаданными на токен. Автор приводит аргументы о калибровочной инвариантности (gauge-invariance) для предотвращения пространственных вращений между экземплярами и доказывает невозможность использования статических ID в общих подпространствах H/W.

Сравнение подходов к позиционному кодированию

Характеристика Стандартный M-RoPE RIG-RoPE (предлагаемый)
Пространственные вращения (H/W) Применяются ко всем парам токенов Только для токенов одного визуального экземпляра
Временные координаты Равные шаги (equal-step counters) Интерполированные кумулятивные длительности
Обработка текста Единичный шаг Единичная длительность
Обработка изображений Единичный шаг Логарифмический пространственный масштаб
Обработка видео Единичный шаг Логарифмическое временное расширение
Доп. параметры Нет Нет (только метаданные)

Данный предварительный технический отчет (15 страниц) устанавливает формулировку и путь валидации, не претендуя пока на эмпирическое превосходство, но закладывая теоретический фундамент для более точного понимания пространственно-временных отношений в мультимодальных нейросетях.

Источник: arXiv cs.CL ↗