Суть проблемы: бенчмарки vs реальность
В индустрии LLM-агентов принято считать, что сжатие контекста (context compression) — это панацея для снижения счетов за токены. Публичные бенчмарки действительно показывают высокую эффективность: модель Paritok-4B сохраняет 86.5% качества решения задач SWE-bench при уровне сжатия 25.7%. Однако авторы исследования подчеркивают: эти метрики ортогональны реальной стоимости работы многошагового агента. Высокий балл на статичном датасете не означает экономии в продакшене, где контекст накапливается.
Методология: A/B тесты с Paritok
Исследователи внедрили шлюз сжатия Paritok между coding-агентами (Claude Code, Codex) и фронтенд-моделями (Claude Sonnet, GPT-5). Они разделили счет за токены на три независимых рычага и измерили их эффект в изолированных A/B тестах:
- Фильтрация схем инструментов (Tool-schema filtering): Удаление неиспользуемых описаний API.
- Сжатие контента (Content compression): Сжатие прочитанных файлов и выводов инструментов.
- Суммаризация истории (History summarization): Сжатие предыдущих диалоговых раундов.
Ключевые цифры: линейный рост против квадратичного
Результаты показали фундаментальные различия в эффективности каждого метода. Фильтрация схем инструментов работает линейно и стабильно, удаляя фиксированный блок токенов (21K–57K) каждый ход. В то же время сжатие контента имеет скрытый недостаток: сжатые данные накапливаются в истории и переотправляются при каждом новом запросе, что приводит к квадратичному росту объема передаваемых данных.
| Метод оптимизации | Характер экономии | Количественная оценка | Влияние на стоимость |
|---|---|---|---|
| Фильтрация схем инструментов | Линейная (по числу ходов N) | 21K–57K токенов/ход | Стабильная и предсказуемая экономия |
| Сжатие контента файлов | Квадратичная (накопление в истории) | ~3350 * N² токенов (накопительно) | Экономия перекрывается повторной отправкой сжатых блоков |
| Недеструктивный шлюз (Recall) | Фиксированный/ограниченный | Стоимость равна размеру одного сегмента | Позволяет вернуть оригинал, но не дает мультипликативной выгоды |
Почему это важно для разработчиков
Исследование демонстрирует, что экономия от сжатия контента составляет лишь около 2% от кэшированного префикса за ход. Однако, поскольку сжатые файлы отправляются заново при каждом новом запросе агента, их «тяжесть» в истории растет. В среднем, экономия от сжатия файлов перекрывается затратами на их повторную отправку уже через 6 ходов (до достижения лимита контекстного окна).
Авторы делают вывод: попытки сэкономить токены за счет агрессивного сжатия файлов в многошаговых агентах часто контрпродуктивны. Единственным надежным рычагом остается фильтрация неиспользуемых схем инструментов. Сильные результаты на бенчмарках (как у Paritok-4B) не должны использоваться как аргумент в пользу снижения операционных расходов (OpEx) в реальных сценариях работы агентов.
Источник: arXiv cs.CL ↗
