Проблема длинного контекста в LLM-агентах
Современные системы на базе больших языковых моделей (LLM) часто работают в режиме многошаговых взаимодействий, вызова инструментов и кросс-сессионных рабочих процессов. Ключевая проблема таких систем — накопление истории. Повторный прогон полного контекста для каждого запроса становится непрактичным: это резко увеличивает стоимость префиллинга (prefill cost), может превысить лимиты контекста и, что самое важное, «прячет» релевантные данные в шуме нерелевантной информации, снижая качество ответов.
Решение: MemAttention и ко-локализация
Команда авторов (Yang Liu, Zhaokai Luo и др.) предложила систему Akashic, построенную вокруг механизма MemAttention. В отличие от простых подходов, Akashic организует контекст в ограниченные чанки (chunks) и моделирует семантические связи между ними. Это позволяет сохранять кросс-чанковые доказательства (cross-chunk evidence) без необходимости переписывать всю историю с нуля.
Дополнительное преимущество достигается за счет hardware-software co-designed memory placement. Система размещает в памяти те чанки, которые с высокой вероятностью будут извлечены вместе, что снижает фрагментацию запросов и накладные расходы на ввод-вывод (I/O overhead).
Результаты бенчмарков
Эксперименты проводились на четырех репрезентативных рабочих нагрузках (workloads) и трех размерах моделей. Akashic продемонстрировал значительное превосходство над сильными базовыми линиями (baselines) в области управления памятью:
| Метрика | Улучшение | Примечание |
|---|---|---|
| Точность задачи (Task Accuracy) | до +10.2 баллов | Значительный рост качества ответов |
| Пропускная способность (Throughput) | до 1.21x | Ускорение обработки запросов |
| Устойчивая частота запросов (Sustainable Request Rate) | до 1.88x | Ключевой показатель для продакшена |
Почему это важно
Рост устойчивой частоты запросов (Sustainable Request Rate) на 88% делает Akashic критически важным для коммерческого развертывания LLM-агентов. Способность эффективно работать с длинными контекстами без экспоненциального роста затрат на префиллинг позволяет создавать более сложные и долгоживущие AI-ассистенты, которые не «забывают» важную информацию из начала сессии, но и не тратят ресурсы на обработку мусора.
Источник: arXiv cs.AI ↗
