Проблема статических координат в мультимодальных LLM
Современные мультимодальные большие языковые модели (LLM) часто используют многомерные варианты Rotary Positional Encoding (RoPE), такие как M-RoPE, разделяющие каналы позиций на временные, высоту и ширину. Однако в интерлированном (переплетенном) контексте, где текст, изображения и видео идут вперемешку, статическое присвоение позиций создает два критических дефекта:
- Пространственные помехи: Вращения по высоте/ширине применяются к парам токенов, пространственное смещение между которыми не является геометрически определенным объектом. Это приводит к перекрестным модальным и межэкземплярным пространственным интерференциям.
- Игнорирование плотности информации: Временные координаты часто обрабатываются как равные шаги. Токен текста, блок изображения и сегмент видео продвигают временную фазу на одинаковую величину, несмотря на колоссальную разницу в информационной плотности.
Решение: RIG-RoPE с учетом длительности
Автор предлагает механизм RIG-RoPE (Relation- and Instance-Gated RoPE), который обогащает каждый токен тремя элементами: индикатором модальности, идентификатором визуального экземпляра и скалярной координатой «информационной длительности». Ключевые особенности:
- Гейтирование по экземплярам: Вращения по высоте/ширине (H/W) применяются только к парам query-key, принадлежащим одному и тому же визуальному экземпляру. Для остальных пар неизвестное пространственное смещение маргинализируется, а не обнуляется.
- Временные координаты с учетом длительности: Временные вращения используют интерполированные кумулятивные длительности блоков. Текст потребляет единичную длительность, изображения используют логарифмический пространственный масштаб, зависящий от размерности, а видео добавляют логарифмическое временное расширение по эффективным кадрам.
Технические преимущества и метрики
Метод RIG-RoPE не требует добавления обучаемых параметров (learned parameters) и может быть реализован внутри ядра внимания с разделением на тайлы (tiled attention kernels) с постоянными дополнительными метаданными на токен. Автор приводит аргументы о калибровочной инвариантности (gauge-invariance) для предотвращения пространственных вращений между экземплярами и доказывает невозможность использования статических ID в общих подпространствах H/W.
Сравнение подходов к позиционному кодированию
| Характеристика | Стандартный M-RoPE | RIG-RoPE (предлагаемый) |
|---|---|---|
| Пространственные вращения (H/W) | Применяются ко всем парам токенов | Только для токенов одного визуального экземпляра |
| Временные координаты | Равные шаги (equal-step counters) | Интерполированные кумулятивные длительности |
| Обработка текста | Единичный шаг | Единичная длительность |
| Обработка изображений | Единичный шаг | Логарифмический пространственный масштаб |
| Обработка видео | Единичный шаг | Логарифмическое временное расширение |
| Доп. параметры | Нет | Нет (только метаданные) |
Данный предварительный технический отчет (15 страниц) устанавливает формулировку и путь валидации, не претендуя пока на эмпирическое превосходство, но закладывая теоретический фундамент для более точного понимания пространственно-временных отношений в мультимодальных нейросетях.
Источник: arXiv cs.CL ↗
