Исследования24 августа 2026 г., 08:19 МСК🤖 Auto

Nexus: ускорение Agentic LLM на Apple Silicon за счет оптимизации KV-кэша

Исследователь Mustafa Arslan представил архитектуру Nexus, устраняющую узкое место Agentic LLM — переполнение контекстного окна при работе с MCP. Решение обеспечивает 1.66x ускорение первого токена и стабильность на Apple Unified Memory.

Баннер новости 6360

Проблема масштабируемости Agentic LLM

В современных агентных системах, использующих Model Context Protocol (MCP), критическим узким местом становится время до первого токена (TTFT). При каждом шаге модель вынуждена заново кодировать (prefill) подробные схемы инструментов (tool schemas). Поскольку стоимость prefill-фазы растет квадратично от длины последовательности, при увеличении реестра инструментов модель быстро достигает предела контекстного окна, что делает дальнейшую работу невозможной.

Архитектура Nexus: Разделение маршрутизации и генерации

Основное решение Nexus заключается в разделении задачи маршрутизации (выбора инструмента) и генерации аргументов. Вместо того чтобы передавать в модель полные схемы, система использует:

  • INT8 Semantic Lookaside Buffer (SLB): Буфер с калиброванным порогом (margin gate) на основе cross-encoder, который выбирает инструмент через поиск (retrieval), а не через полное перекодирование.
  • Сжатые текстовые сигнатуры: Аргументы генерируются на основе сжатого описания (медиана 19 токенов), а не через splice ключей и значений (KV-cache).

Этот подход делает маршрутизацию независимой от глубины контекста. Точность выбора инструмента остается на уровне ~89% даже при масштабировании реестра до 250 инструментов, тогда как базовый метод «конкатенации всех схем» полностью переполняет окно контекста.

Вторичный механизм: Depth-Adaptive KV-Cache Splicing

Для ускорения на умеренных глубинах контекста Nexus внедряет скомпилированный блок схемы KV-кэша непосредственно в живой контекст. Однако этот метод ограничен фазовым сдвигом позиционных эмбеддингов (RoPE). Если блок размещен не в «якорной» позиции, внимание (attention) искажается. Для исправления этого Nexus использует адаптивный suffix-redecode, который при превышении порога P=256 переключается на полное перекодирование. Это гарантирует сохранность вывода (top-1 agreement, D_KL ≈ 0), хотя и может временно замедлить процесс (до 0.98x) перед стабилизацией.

Результаты бенчмарков на Qwen2.5-14B

Все измерения проведены на модели Qwen2.5-14B-Instruct (квантование Q4_K_M) в среде Apple Silicon с унифицированной памятью. Ключевые метрики эффективности представлены ниже:

Метрика / Параметр Результат Nexus Сравнение / Примечание
Ускорение первого аргумента 1.66x Быстрее полного schema-prefill
Экономия токенов ~80% Сокращение основного контекста
Точность маршрутизации ~89% Стабильна при 250 инструментах
Ускорение TTFT (умеренная глубина) 1.1–1.7x Снижается до паритета на глубоком контексте
Порог RoPE-сдвига (P) 256 Точка переключения на redecode

Ограничения и выводы

Исследование также выявило два негативных результата, ограничивающих дизайн: границу верности RoPE при off-anchor размещении и неспособность reference-free drift gate предсказать сдвиг (коэффициент Спирмена ρ = 0.193). Хотя количественные показатели специфичны для пары Qwen2.5-14B и Apple Silicon, качественные границы применимы к другим архитектурам.

Источник: arXiv cs.AI ↗