Проблема: два пути к провалу
Большие языковые модели (LLM) сталкиваются с фундаментальным ограничением — коллапсом представлений, который критически снижает качество работы с длинным контекстом. Авторы исследования (Yiheng Tao, Kaiwen Cheng, Yao Lu, Chang Liu, Jie Chen) выявили, что существующие методы борьбы с этим явлением часто приводят к двум патологическим состояниям:
- Гомогенизация (Homogenization collapse): например, эффект «attention sinks» приводит к снижению ранга матриц внимания, делая представления томов избыточными и одинаковыми.
- Изоляция (Isolation collapse): локальное внимание разрывает связь между частями контекста, теряя глобальную информацию.
Спектральный анализ показал, что стандартные механизмы не могут одновременно балансировать эффективность смешивания (спектральный зазор) и информационную емкость (эффективный ранг).
Решение: TRSP без изменения ядра
Команда предложила Topologically Regularized Side-Path (TRSP) — неинвазивное архитектурное вмешательство. Ключевые особенности:
- Triangular Box: параметрически свободный механизм, масштабируемый легковесным гейтом, чувствительным к длине контекста.
- Проксимальное связывание: сохраняет эффективный ранг представлений.
- Дистальная пропелляция: обеспечивает неденеративное смешивание информации на расстоянии.
TRSP не меняет ядро внимания, а лишь регулирует топологию взаимодействия токенов, создавая более «геометрически здоровый» переходный оператор.
Результаты: прорыв на длинных контекстах
Эксперименты показали значительное улучшение общих способностей и работы с длинным контекстом. Особенно впечатляющие результаты на бенчмарке NoLiMa при длине контекста, в 8 раз превышающей обучающую:
| Метод | Точность на NoLiMa (8x длина) | Примечание |
|---|---|---|
| TRSP (предложенный) | 83% | Базовый результат |
| Differential Transformer | ~53% | TRSP превосходит на ~30 п.п. |
| Gated Attention | ~33% | TRSP превосходит на ~50 п.п. |
Значение для индустрии
Работа, представленная на ICML 2026, демонстрирует, что можно улучшить масштабирование LLM без перестройки архитектуры внимания. Код решения доступен для воспроизведения, что открывает путь к созданию более эффективных моделей для работы с большими объемами данных (документы, код, длинные диалоги).
Источник: arXiv cs.AI ↗
