Проблема «Token Maxing» в корпоративном AI
Разработка агентов ИИ сегодня страдает от феномена «token maxing»token maxing»: компании покупают возможности через токены. Разработчики увеличивают длину цепочек рассуждений, количество шагов и объем контекста, из-за чего стоимость задачи растет быстрее, чем ее ценность. Падение цены за токен маскирует проблему: общий бюджет все равно взлетает.
Авторы исследования (команда Writer AI во главе с Муядом Сайедом Али) утверждают, что ключевым рычагом контроля затрат является не сама модель, а «harness» — оркестрационный слой, который собирает контекст, управляет инструментами, последовательностью шагов и обеспечивает наблюдаемость (observability).
Методология: контролируемый эксперимент
Для проверки гипотезы команда провела контролируемый тест на 22 фиксированных задачах. Единственным переменным фактором была замена оркестрационного слоя: сравнивался стандартный производственный цикл (conventional production loop) и новый Writer Agent Harness. При этом модели оставались неизменными.
В тесте участвовали шесть фундаментальных моделей:
- Claude Sonnet 4.6
- Gemini 3.1
- Gemini Flash 3.5
- Qwen 3.6
- GLM 5.1
- Palmyra X6
Результаты: эффективность выше, чем у моделей
Результаты показали, что архитектура оркестрации влияет на экономику задачи сильнее, чем выбор между разными моделями. Внедрение Writer Agent Harness дало следующие результаты:
| Метрика | Стандартный цикл | Writer Agent Harness | Изменение |
|---|---|---|---|
| Средняя стоимость задачи | $0.21 | $0.12 | -41% |
| Медианное время выполнения | 48 сек | 27 сек | -44% |
| Токенов на задачу | 14.2k | 8.8k | -38% |
| Качество выполнения | 0.78 | 0.81 | +3.8% (паритет/рост) |
| Качество за доллар | — | — | +82% |
| Задач на 1 млн токенов | 54.9 | 92.0 | +67% |
Эффект рычага (Harness Leverage)
Эффект экономии инвариантен к модели: каждая из шести протестированных моделей стала дешевле на 33–61%. Однако прирост качества зависит от базовой силы модели. Существует почти идеальная корреляция (r=0.99) между исходной мощностью модели и тем, насколько сильно она выигрывает от использования продвинутого harness. Авторы называют это «harness leverage».
Почему это важно для бизнеса
Исследование формализует экономику токенов на уровне оркестрации, включая эффективную цену ввода при использовании prompt caching. Шесть семейств механизмов, лежащих в основе эффекта, варьируются от дисциплины формы кэша до управления затратами при сбоях. Главный вывод: оркестрационный слой — это единственный компонент, эффективность которого умножается на все модели, которые использует организация, как текущие, так и будущие.
Источник: arXiv cs.AI ↗
