Проблема скрытых затрат в агентах
В системах с LLM-агентами, где модель может ошибаться и требовать повторных попыток (retries), стандартная тарификация за токен вводит в заблуждение. Авторы вводят понятие token inflation (инфляция токенов) — отношение реальной стоимости рабочего процесса к стоимости одного вызова. Системы маршрутизации, такие как FrugalGPT, опираются только на цену одного вызова, что приводит к недооценке реальных затрат более чем в 2 раза на сложных задачах.
Метрика CBE и Semantic Exchange Rate
InflationAgent использует четырехэтапный роутер, ключевым элементом которого является CoT Branching Entropy (CBE). Этот сигнал сложности вычисляется полностью локально, до выполнения запроса, и предсказывает высокую инфляцию токенов с AUROC 0.887. На основе этого роутер максимизирует Semantic Exchange Rate (SER) — отношение ожидаемой точности к предсказанной реальной стоимости.
Результаты на бенчмарке GSM8K
Эксперименты показали, что InflationAgent превосходит аналоги по эффективности. При фиксированном бюджете система достигает точности 94,7% (против 91,0% у FrugalGPT), расходуя на 31% меньше токенов. Ниже приведено сравнение ключевых метрик:
| Метрика | InflationAgent | FrugalGPT |
|---|---|---|
| Точность (GSM8K) | 94.7% | 91.0% |
| Расход токенов | Базовый (экономия 31%) | Выше на 31% |
| Инфляция токенов (7B модель) | До 4.25x (выявлено) | Игнорируется |
Важность «Fresh-Escalation»
Особое внимание уделено политике fresh-escalation: система отбрасывает неудачные цепочки рассуждений перед передачей задачи более сильной модели. Это критически важно, так как передача неудачного контекста в GPT-4o снижает её точность на 34.8 процентных пункта. Игнорирование этого эффекта сводит на нет преимущества использования мощных моделей.
Источник: arXiv cs.CL ↗
