Почему большие окна не спасают
Ожидание, что просто увеличение контекстного окна решит проблемы долгосрочных задач, опровергнуто данными. Отчет Chroma Context Rot, протестировавший 18 моделей (включая GPT-4.1, Claude 4, Gemini 2.5, Qwen3), показал: производительность резко падает с ростом длины ввода, даже на простых задачах поиска. Причина — квадратичная сложность внимания ($n^2$): каждый новый токен истощает ограниченный «бюджет внимания» модели. Для агентов это критично: соотношение входных/выходных токенов достигает 100:1. Инструкция теряется в середине окна, где recall деградирует сильнее всего.
Механизм 1: Бюджетирование и выгрузка (Offloading)
Задача Harness — не пускать лишнее в окно. LangChain Deep Agents внедряет жесткие правила: если ответ инструмента превышает 20 000 токенов, он записывается на диск, а в контекст попадает только путь и превью первых 10 строк. При заполнении окна на 85% старые вызовы редактирования файлов заменяются на указатели. Claude Code применяет аналогичную стратегию: авто-память ограничена 200 строками (25 КБ), а схемы инструментов (MCP) загружаются только по запросу. Это позволяет субагенту прочитать 6 100 токенов файлов и вернуть родителю сжатый результат в 420 токенов.
Механизм 2: Компактизация (Compaction)
Когда выгрузка исчерпана, Harness суммирует историю. Ключевая разница — в том, что сохраняется. Claude Code сохраняет архитектурные решения и нерешенные баги, но отбрасывает дублирующиеся выводы инструментов. После компактизации он повторно загружает до 5 последних измененных файлов. OpenAI в Responses API вынесло это в API: параметр compact_threshold и эндпоинт /responses/compact возвращают зашифрованный сжатый контекст, который Codex использует для долгих задач. LangChain Deep Agents структурирует итог в документ с полями «намерение сессии», «созданные артефакты» и «следующие шаги», сохраняя полный транскрипт на диске для восстановления.
Механизм 3: Todo-state и рецитация
Чтобы цель не терялась между шагами, Manus и другие агенты используют todo.md. Агент переписывает список задач, зачеркивая пункты. Это «рецитирует» цели в конец контекста, где внимание модели максимально. LangChain в версии v0.7 (июль 2026) сделала TodoListMiddleware опциональным: тесты показали, что для коротких задач отключение туду-листа снижает стоимость и повышает награду, но для длинных многошаговых сценариев паттерн остается критически важным.
Механизм 4: Стратегия памяти между сессиями
Последний слой — персистентность. AWS AgentCore Memory хранит события и извлекает контекст в фоне, позволяя координатору вызывать инструмент recall в новой сессии. Claude Code после каждой компактизации перезагружает CLAUDE.md из корня проекта. Это превращает цель из «сообщения в истории», которое стареет и суммируется, в «изменяемый артефакт» на диске, который всегда свеж и короток.
| Платформа/Инструмент | Ключевая метрика или лимит | Механизм работы |
|---|---|---|
| LangChain Deep Agents | 20 000 токенов (ответы) | Offloading на диск, структурированное суммирование с полями intent/artifacts |
| Claude Code | 25 КБ / 200 строк (авто-память) | Deferred loading схем, перезагрузка 5 последних файлов после компактизации |
| OpenAI Codex | API /responses/compact |
Серверная компактизация с зашифрованным окном, передача его в следующий вызов |
| Manus | ~50 вызовов на задачу | Использование todo.md для рецитации целей в конец контекста |
| AWS AgentCore | 3 субагента в MicroVM | Параллельный сбор данных, возврат только структурированных выводов аналитику |
Источник: MarkTechPost ↗
