Исследования22 сентября 2026 г., 17:47 МСК🤖 Auto

Миф о сжатии контекста: почему Paritok не экономит токены в агентах

Исследование авторов Luzhuo Chen и Jiayu Shi (arXiv:2609.22114) развенчивает популярный миф: агрессивное сжатие контекста в многошаговых coding-агентах (Claude Code, Codex) не дает ожидаемой экономии. Реальные метрики показывают, что выгода от сжатия

Баннер новости 8048

Суть проблемы: бенчмарки vs реальность

В индустрии LLM-агентов принято считать, что сжатие контекста (context compression) — это панацея для снижения счетов за токены. Публичные бенчмарки действительно показывают высокую эффективность: модель Paritok-4B сохраняет 86.5% качества решения задач SWE-bench при уровне сжатия 25.7%. Однако авторы исследования подчеркивают: эти метрики ортогональны реальной стоимости работы многошагового агента. Высокий балл на статичном датасете не означает экономии в продакшене, где контекст накапливается.

Методология: A/B тесты с Paritok

Исследователи внедрили шлюз сжатия Paritok между coding-агентами (Claude Code, Codex) и фронтенд-моделями (Claude Sonnet, GPT-5). Они разделили счет за токены на три независимых рычага и измерили их эффект в изолированных A/B тестах:

  • Фильтрация схем инструментов (Tool-schema filtering): Удаление неиспользуемых описаний API.
  • Сжатие контента (Content compression): Сжатие прочитанных файлов и выводов инструментов.
  • Суммаризация истории (History summarization): Сжатие предыдущих диалоговых раундов.

Ключевые цифры: линейный рост против квадратичного

Результаты показали фундаментальные различия в эффективности каждого метода. Фильтрация схем инструментов работает линейно и стабильно, удаляя фиксированный блок токенов (21K–57K) каждый ход. В то же время сжатие контента имеет скрытый недостаток: сжатые данные накапливаются в истории и переотправляются при каждом новом запросе, что приводит к квадратичному росту объема передаваемых данных.

Метод оптимизации Характер экономии Количественная оценка Влияние на стоимость
Фильтрация схем инструментов Линейная (по числу ходов N) 21K–57K токенов/ход Стабильная и предсказуемая экономия
Сжатие контента файлов Квадратичная (накопление в истории) ~3350 * N² токенов (накопительно) Экономия перекрывается повторной отправкой сжатых блоков
Недеструктивный шлюз (Recall) Фиксированный/ограниченный Стоимость равна размеру одного сегмента Позволяет вернуть оригинал, но не дает мультипликативной выгоды

Почему это важно для разработчиков

Исследование демонстрирует, что экономия от сжатия контента составляет лишь около 2% от кэшированного префикса за ход. Однако, поскольку сжатые файлы отправляются заново при каждом новом запросе агента, их «тяжесть» в истории растет. В среднем, экономия от сжатия файлов перекрывается затратами на их повторную отправку уже через 6 ходов (до достижения лимита контекстного окна).

Авторы делают вывод: попытки сэкономить токены за счет агрессивного сжатия файлов в многошаговых агентах часто контрпродуктивны. Единственным надежным рычагом остается фильтрация неиспользуемых схем инструментов. Сильные результаты на бенчмарках (как у Paritok-4B) не должны использоваться как аргумент в пользу снижения операционных расходов (OpEx) в реальных сценариях работы агентов.

Источник: arXiv cs.CL ↗