Проблема длинного контекста
Инференс больших языковых моделей (LLM) с длинным контекстом остается ресурсоемким. Самовнимание (self-attention) во время префиллинга масштабируется квадратично с длиной последовательности, а кэш ключей и значений (KV-cache) растет пропорционально количеству обработанных токенов. Существующие методы сжатия часто используют LLM в качестве компрессоров, что создает дополнительные вычислительные затраты и может снижать качество ответа.
Архитектура SeDeM
Новый фреймворк SeDeM (Selective Decompression of Hidden-State Memories) предлагает иной подход. Он разделяет хранение компактной памяти и условие декодера. Процесс включает четыре этапа:
- Извлечение: LLM извлекает скрытые состояния (hidden states) из выбранного промежуточного слоя Transformer.
- Компрессия: Легковесный компрессор сохраняет их в виде блоков памяти.
- Селекция: Селектор, управляемый запросом, выбирает только релевантные блоки.
- Декомпрессия: Декомпрессор расширяет выбранные блоки обратно в скрытые состояния, совместимые с промежуточным слоем декодера.
Это позволяет декодеру избегать обработки полного контекста и генерации напрямую из сильно сжатых слотов памяти.
Результаты бенчмарков
Метод был протестирован на четырех бенчмарках для поиска ответов в длинном контексте (Long-Context QA). SeDeM показал более высокие баллы по сравнению с базовыми методами сжатия как в конфигурациях с 1B, так и с 3B параметрами того же бэкбона. Примечательно, что модель с 3B параметрами превзошла модели, дообученные на полном контексте, на трех из четырех датасетов.
| Метрика / Характеристика | Результат SeDeM | Сравнение / Примечание |
|---|---|---|
| Точность QA (Long-Context) | Выше базовых методов сжатия | Для бэкбонов 1B и 3B |
| Точность QA (3B Backbone) | Превосходит full-context fine-tuning | На 3 из 4 датасетов |
| Time-to-first-token | Снижено | Относительно ICAE |
| Пропускная способность декодирования | Улучшена | Относительно ICAE |
Значение для индустрии
SeDeM демонстрирует, что эффективная работа с длинным контекстом не требует обязательного использования огромных моделей или полной обработки всех токенов. Использование обучения с блокировочным надзором за доказательствами (block-level evidence supervision) позволяет селектору точно определять релевантную информацию, что критически важно для приложений, требующих быстрого отклика и высокой точности при работе с большими объемами данных.
Источник: arXiv cs.CL ↗
