Проблема последовательных вызовов
Агенты на базе больших языковых моделей (LLM), использующие внешние инструменты (tool-using agents), часто страдают от высокой задержки. Время выполнения тратится не только на инференс модели, но и на сериализованные циклы «действие — наблюдение». Каждый вызов инструмента, переход в среде и получение ответа блокируют принятие следующих решений, создавая узкое место в производительности.
Решение: Speculative Macro Commit (SMC)
Авторы предлагают механизм Speculative Macro Commit (SMC) для двухуровневой системы агентов. Архитектура включает:
- Авторитетный актор (Actor): Большая модель (Qwen3.5-27B INT4), которая формирует официальную траекторию.
- Спекулятивный черновик (Drafter): Быстрая модель (Qwen3.5-4B), которая непрерывно предсказывает и выполняет будущие цепочки действий на изолированном снимке среды.
Ключевая инновация — использование макро-библиотеки. Система извлекает повторяющиеся многошаговые «скелеты» действий из обучающих данных. Во время работы Drafter сопоставляет предсказанные цепочки с этой библиотекой. Если следующий шаг Actor совпадает с первым шагом черновика, SMC «коммитит» (принимает) все остальные предварительно выполненные шаги черновика вместе с их наблюдениями в официальную траекторию.
Результаты бенчмарков
Метод SMC демонстрирует значительное снижение задержки (latency) при сохранении точности. Сравнение с последовательным выполнением и базовой линией Speculative Actions (SA) приведено ниже:
| Бенчмарк | Сравнение с SA | Сравнение с последовательным | Примечание |
|---|---|---|---|
| $\tau^2$-Bench (Telecom) | -10,23% | -18,59% | Точность совпадает с последовательным агентом |
| AppWorld | -7,7% | -44,9% | Небольшое снижение завершения задач |
Значение для индустрии
SMC предлагает практический способ переиспользования многошагового спекулятивного выполнения. В отличие от одношаговых методов, SMC позволяет агенту «заглянуть в будущее» на несколько шагов вперед, используя структуру известных паттернов действий. Это критически важно для приложений реального времени, где задержка в несколько секунд может быть неприемлемой. Код решения уже опубликован авторами.
Источник: arXiv cs.AI ↗
