Исследования5 августа 2026 г., 04:18 МСК🤖 Auto

SeDeM: Прорыв в работе с длинным контекстом LLM

Исследователи представили SeDeM — метод селективного декомпрессионирования скрытых состояний, который позволяет LLM эффективно работать с длинными контекстами, превосходя полноразмерные модели по точности.

Баннер новости 5095

Проблема длинного контекста

Инференс больших языковых моделей (LLM) с длинным контекстом остается ресурсоемким. Самовнимание (self-attention) во время префиллинга масштабируется квадратично с длиной последовательности, а кэш ключей и значений (KV-cache) растет пропорционально количеству обработанных токенов. Существующие методы сжатия часто используют LLM в качестве компрессоров, что создает дополнительные вычислительные затраты и может снижать качество ответа.

Архитектура SeDeM

Новый фреймворк SeDeM (Selective Decompression of Hidden-State Memories) предлагает иной подход. Он разделяет хранение компактной памяти и условие декодера. Процесс включает четыре этапа:

  • Извлечение: LLM извлекает скрытые состояния (hidden states) из выбранного промежуточного слоя Transformer.
  • Компрессия: Легковесный компрессор сохраняет их в виде блоков памяти.
  • Селекция: Селектор, управляемый запросом, выбирает только релевантные блоки.
  • Декомпрессия: Декомпрессор расширяет выбранные блоки обратно в скрытые состояния, совместимые с промежуточным слоем декодера.

Это позволяет декодеру избегать обработки полного контекста и генерации напрямую из сильно сжатых слотов памяти.

Результаты бенчмарков

Метод был протестирован на четырех бенчмарках для поиска ответов в длинном контексте (Long-Context QA). SeDeM показал более высокие баллы по сравнению с базовыми методами сжатия как в конфигурациях с 1B, так и с 3B параметрами того же бэкбона. Примечательно, что модель с 3B параметрами превзошла модели, дообученные на полном контексте, на трех из четырех датасетов.

Метрика / Характеристика Результат SeDeM Сравнение / Примечание
Точность QA (Long-Context) Выше базовых методов сжатия Для бэкбонов 1B и 3B
Точность QA (3B Backbone) Превосходит full-context fine-tuning На 3 из 4 датасетов
Time-to-first-token Снижено Относительно ICAE
Пропускная способность декодирования Улучшена Относительно ICAE

Значение для индустрии

SeDeM демонстрирует, что эффективная работа с длинным контекстом не требует обязательного использования огромных моделей или полной обработки всех токенов. Использование обучения с блокировочным надзором за доказательствами (block-level evidence supervision) позволяет селектору точно определять релевантную информацию, что критически важно для приложений, требующих быстрого отклика и высокой точности при работе с большими объемами данных.

Источник: arXiv cs.CL ↗