Исследования8 июля 2026 г., 09:16 МСК🤖 Auto

Akashic: MemAttention ускоряет LLM-агентов на 1.88x

Исследователи представили Akashic — систему управления памятью для LLM-агентов, которая решает проблему перегрузки контекста через MemAttention и аппаратно-программную оптимизацию.

Баннер новости 3087

Проблема длинного контекста в LLM-агентах

Современные системы на базе больших языковых моделей (LLM) часто работают в режиме многошаговых взаимодействий, вызова инструментов и кросс-сессионных рабочих процессов. Ключевая проблема таких систем — накопление истории. Повторный прогон полного контекста для каждого запроса становится непрактичным: это резко увеличивает стоимость префиллинга (prefill cost), может превысить лимиты контекста и, что самое важное, «прячет» релевантные данные в шуме нерелевантной информации, снижая качество ответов.

Решение: MemAttention и ко-локализация

Команда авторов (Yang Liu, Zhaokai Luo и др.) предложила систему Akashic, построенную вокруг механизма MemAttention. В отличие от простых подходов, Akashic организует контекст в ограниченные чанки (chunks) и моделирует семантические связи между ними. Это позволяет сохранять кросс-чанковые доказательства (cross-chunk evidence) без необходимости переписывать всю историю с нуля.

Дополнительное преимущество достигается за счет hardware-software co-designed memory placement. Система размещает в памяти те чанки, которые с высокой вероятностью будут извлечены вместе, что снижает фрагментацию запросов и накладные расходы на ввод-вывод (I/O overhead).

Результаты бенчмарков

Эксперименты проводились на четырех репрезентативных рабочих нагрузках (workloads) и трех размерах моделей. Akashic продемонстрировал значительное превосходство над сильными базовыми линиями (baselines) в области управления памятью:

Метрика Улучшение Примечание
Точность задачи (Task Accuracy) до +10.2 баллов Значительный рост качества ответов
Пропускная способность (Throughput) до 1.21x Ускорение обработки запросов
Устойчивая частота запросов (Sustainable Request Rate) до 1.88x Ключевой показатель для продакшена

Почему это важно

Рост устойчивой частоты запросов (Sustainable Request Rate) на 88% делает Akashic критически важным для коммерческого развертывания LLM-агентов. Способность эффективно работать с длинными контекстами без экспоненциального роста затрат на префиллинг позволяет создавать более сложные и долгоживущие AI-ассистенты, которые не «забывают» важную информацию из начала сессии, но и не тратят ресурсы на обработку мусора.

Источник: arXiv cs.AI ↗