Исследования24 июля 2026 г., 14:17 МСК🤖 Auto

TRSP: Как топологическая регуляризация спасает LLM от коллапса представлений

Исследователи представили метод TRSP, устраняющий проблему коллапса представлений в больших языковых моделях. Новый подход позволяет моделям сохранять точность на контекстах в 8 раз длиннее обучающих, превосходя аналоги на 30-50 п.п.

Баннер новости 4295

Проблема: два пути к провалу

Большие языковые модели (LLM) сталкиваются с фундаментальным ограничением — коллапсом представлений, который критически снижает качество работы с длинным контекстом. Авторы исследования (Yiheng Tao, Kaiwen Cheng, Yao Lu, Chang Liu, Jie Chen) выявили, что существующие методы борьбы с этим явлением часто приводят к двум патологическим состояниям:

  • Гомогенизация (Homogenization collapse): например, эффект «attention sinks» приводит к снижению ранга матриц внимания, делая представления томов избыточными и одинаковыми.
  • Изоляция (Isolation collapse): локальное внимание разрывает связь между частями контекста, теряя глобальную информацию.

Спектральный анализ показал, что стандартные механизмы не могут одновременно балансировать эффективность смешивания (спектральный зазор) и информационную емкость (эффективный ранг).

Решение: TRSP без изменения ядра

Команда предложила Topologically Regularized Side-Path (TRSP) — неинвазивное архитектурное вмешательство. Ключевые особенности:

  • Triangular Box: параметрически свободный механизм, масштабируемый легковесным гейтом, чувствительным к длине контекста.
  • Проксимальное связывание: сохраняет эффективный ранг представлений.
  • Дистальная пропелляция: обеспечивает неденеративное смешивание информации на расстоянии.

TRSP не меняет ядро внимания, а лишь регулирует топологию взаимодействия токенов, создавая более «геометрически здоровый» переходный оператор.

Результаты: прорыв на длинных контекстах

Эксперименты показали значительное улучшение общих способностей и работы с длинным контекстом. Особенно впечатляющие результаты на бенчмарке NoLiMa при длине контекста, в 8 раз превышающей обучающую:

Метод Точность на NoLiMa (8x длина) Примечание
TRSP (предложенный) 83% Базовый результат
Differential Transformer ~53% TRSP превосходит на ~30 п.п.
Gated Attention ~33% TRSP превосходит на ~50 п.п.

Значение для индустрии

Работа, представленная на ICML 2026, демонстрирует, что можно улучшить масштабирование LLM без перестройки архитектуры внимания. Код решения доступен для воспроизведения, что открывает путь к созданию более эффективных моделей для работы с большими объемами данных (документы, код, длинные диалоги).

Источник: arXiv cs.AI ↗