Проблема: Трата ресурсов на повторный код
Продакшн-агенты на базе больших языковых моделей (LLM) часто тратят драгоценное время и вычислительные ресурсы на генерацию кода для одних и тех же процедурных шагов при каждом новом запросе. Этот подход, известный как inference-time coding loop, создает узкое место в системах с низкими задержками (low-latency systems), где скорость критична.
Решение: Pipeline Tool-Making
Авторы из команды Kalle Kujanpää и коллег предлагают заменить генерацию кода на лету конвейером создания инструментов (tool-making). Система работает по следующему алгоритму:
- Сбор данных: Агенты собирают трассы выполнения (execution traces) в живой среде.
- Анализ: Изучаются схемы бэкендов и значения данных.
- Генерация и исправление: Создаются кандидаты на роль инструментов, которые затем «ремонтируются» (repair) на основе размеченных случаев (labeled cases).
- Версионирование: Готовые инструменты версионируются и внедряются в продакшн до начала работы агентов.
Результаты в продакшене: Система оповещений
Методология была протестирована в реальной системе триажирования оповещений (alarm-triage) на распределительном складе (Fulfillment Center). Агенты диагностировали оповещения, опираясь на SOP (стандартные операционные процедуры) из 44 узлов и гетерогенные бэкенды метрик. Результаты внедрения Tool-Making показали значительный прирост эффективности:
| Метрика | Показатель | Примечание |
|---|---|---|
| Снижение p50 latency | 42% | За счет прямого вызова инструментов вместо генерации кода |
| Снижение ошибки (end-to-end error rate) | до 53% | На 1 500 исторических оповещениях за счет подавления вариативности |
| Дополнительное снижение p50 latency (абляция) | 62% | При использовании компактных структурированных вердиктов от инструментов |
Почему это важно для индустрии
Помимо скорости, система решает проблемы надежности и аудита. Версионированные инструменты позволяют отслеживать дрейф данных (data drift) на上游 (upstream) и выявлять пробелы в спецификациях. Агенты, способные к самоэволюции через создание инструментов, делают промышленные LLM-системы не только быстрее, но и проще в эксплуатации, так как они падают в режим генерации кода только в тех случаях, когда готового инструмента еще не существует.
Источник: arXiv cs.CL ↗
