Исследования14 августа 2026 г., 02:18 МСК🤖 Auto

Lost in Compaction: Почему LLM забывают инструкции при сжатии контекста

Исследование COMPINT выявило критический дефект в системах сжатия контекста: LLM теряют до 83% пользовательских ограничений (Session Constraints) при оптимизации окна. Представлено решение с удержанием >90% без изменения базовой модели.

Баннер новости 5753

Проблема: «Невидимая» потеря инструкций

При работе с длинными диалогами или сложными задачами LLM-системы часто используют контекстное сжатие (context compaction) для экономления токенов. Авторы исследования (Zhiqi Wang, Yichi Zhang, Dongwon Lee, Yuchen Yang) обнаружили системную ошибку: инструкции пользователя, требующие сохранения состояния сессии (Session Constraints, SC), такие как «не удалять письма до подтверждения», игнорируются алгоритмами сжатия. Это приводит к тому, что модель «забывает» правила поведения, заложенные в начале диалога.

Методология и метрики: Suite COMPINT

Для оценки масштаба проблемы создана оценка COMPINT, протестированная на трех сценариях: многооборотный чат, агентные траектории и долгосрочные исследования. Результаты показали катастрофическую потерю информации:

Метрика / Параметр Результат / Значение
Среднее удержание SC текущими компакторами 17%
Эффективность против базового режима (без сжатия) Большинство компакторов работают хуже оригинала
Удержание с предложенным SC-aware extractor >90%
Требования к интеграции решения Plug-and-play модуль, без изменения компактора или LLM

Факторы влияния

Потеря инструкций не является случайной. Исследование выявило, что удержание сильно зависит от:

  • Конкретного используемого компактора;
  • Формулировки промпта;
  • Длины контекста;
  • Фразировки самого ограничения (SC phrasing);
  • Места инъекции инструкции в контекст.

Решение: SC-aware extractor

Авторы предлагают модуль SC-aware extractor, который работает параллельно с компактором. Он извлекает и сохраняет сессионные ограничения, обеспечивая удержание более 90% инструкций во всех протестированных сценариях. Это позволяет сохранить целостность сложных задач без необходимости переобучения базовых моделей или изменения архитектуры компакторов.

Источник: arXiv cs.CL ↗