Проблема масштабируемости Agentic LLM
В современных агентных системах, использующих Model Context Protocol (MCP), критическим узким местом становится время до первого токена (TTFT). При каждом шаге модель вынуждена заново кодировать (prefill) подробные схемы инструментов (tool schemas). Поскольку стоимость prefill-фазы растет квадратично от длины последовательности, при увеличении реестра инструментов модель быстро достигает предела контекстного окна, что делает дальнейшую работу невозможной.
Архитектура Nexus: Разделение маршрутизации и генерации
Основное решение Nexus заключается в разделении задачи маршрутизации (выбора инструмента) и генерации аргументов. Вместо того чтобы передавать в модель полные схемы, система использует:
- INT8 Semantic Lookaside Buffer (SLB): Буфер с калиброванным порогом (margin gate) на основе cross-encoder, который выбирает инструмент через поиск (retrieval), а не через полное перекодирование.
- Сжатые текстовые сигнатуры: Аргументы генерируются на основе сжатого описания (медиана 19 токенов), а не через splice ключей и значений (KV-cache).
Этот подход делает маршрутизацию независимой от глубины контекста. Точность выбора инструмента остается на уровне ~89% даже при масштабировании реестра до 250 инструментов, тогда как базовый метод «конкатенации всех схем» полностью переполняет окно контекста.
Вторичный механизм: Depth-Adaptive KV-Cache Splicing
Для ускорения на умеренных глубинах контекста Nexus внедряет скомпилированный блок схемы KV-кэша непосредственно в живой контекст. Однако этот метод ограничен фазовым сдвигом позиционных эмбеддингов (RoPE). Если блок размещен не в «якорной» позиции, внимание (attention) искажается. Для исправления этого Nexus использует адаптивный suffix-redecode, который при превышении порога P=256 переключается на полное перекодирование. Это гарантирует сохранность вывода (top-1 agreement, D_KL ≈ 0), хотя и может временно замедлить процесс (до 0.98x) перед стабилизацией.
Результаты бенчмарков на Qwen2.5-14B
Все измерения проведены на модели Qwen2.5-14B-Instruct (квантование Q4_K_M) в среде Apple Silicon с унифицированной памятью. Ключевые метрики эффективности представлены ниже:
| Метрика / Параметр | Результат Nexus | Сравнение / Примечание |
|---|---|---|
| Ускорение первого аргумента | 1.66x | Быстрее полного schema-prefill |
| Экономия токенов | ~80% | Сокращение основного контекста |
| Точность маршрутизации | ~89% | Стабильна при 250 инструментах |
| Ускорение TTFT (умеренная глубина) | 1.1–1.7x | Снижается до паритета на глубоком контексте |
| Порог RoPE-сдвига (P) | 256 | Точка переключения на redecode |
Ограничения и выводы
Исследование также выявило два негативных результата, ограничивающих дизайн: границу верности RoPE при off-anchor размещении и неспособность reference-free drift gate предсказать сдвиг (коэффициент Спирмена ρ = 0.193). Хотя количественные показатели специфичны для пары Qwen2.5-14B и Apple Silicon, качественные границы применимы к другим архитектурам.
Источник: arXiv cs.AI ↗
