Инструменты13 сентября 2026 г., 09:17 МСК🤖 Auto

Context Engineering: 4 механизма Harness для борьбы с потерей контекста

AWS и ведущие AI-лаборатории доказали: увеличение контекстного окна не решает проблему «потери цели» у агентов. Разбор 4 архитектурных паттернов Harness, которые реально работают.

Баннер новости 7380

Почему большие окна не спасают

Ожидание, что просто увеличение контекстного окна решит проблемы долгосрочных задач, опровергнуто данными. Отчет Chroma Context Rot, протестировавший 18 моделей (включая GPT-4.1, Claude 4, Gemini 2.5, Qwen3), показал: производительность резко падает с ростом длины ввода, даже на простых задачах поиска. Причина — квадратичная сложность внимания ($n^2$): каждый новый токен истощает ограниченный «бюджет внимания» модели. Для агентов это критично: соотношение входных/выходных токенов достигает 100:1. Инструкция теряется в середине окна, где recall деградирует сильнее всего.

Механизм 1: Бюджетирование и выгрузка (Offloading)

Задача Harness — не пускать лишнее в окно. LangChain Deep Agents внедряет жесткие правила: если ответ инструмента превышает 20 000 токенов, он записывается на диск, а в контекст попадает только путь и превью первых 10 строк. При заполнении окна на 85% старые вызовы редактирования файлов заменяются на указатели. Claude Code применяет аналогичную стратегию: авто-память ограничена 200 строками (25 КБ), а схемы инструментов (MCP) загружаются только по запросу. Это позволяет субагенту прочитать 6 100 токенов файлов и вернуть родителю сжатый результат в 420 токенов.

Механизм 2: Компактизация (Compaction)

Когда выгрузка исчерпана, Harness суммирует историю. Ключевая разница — в том, что сохраняется. Claude Code сохраняет архитектурные решения и нерешенные баги, но отбрасывает дублирующиеся выводы инструментов. После компактизации он повторно загружает до 5 последних измененных файлов. OpenAI в Responses API вынесло это в API: параметр compact_threshold и эндпоинт /responses/compact возвращают зашифрованный сжатый контекст, который Codex использует для долгих задач. LangChain Deep Agents структурирует итог в документ с полями «намерение сессии», «созданные артефакты» и «следующие шаги», сохраняя полный транскрипт на диске для восстановления.

Механизм 3: Todo-state и рецитация

Чтобы цель не терялась между шагами, Manus и другие агенты используют todo.md. Агент переписывает список задач, зачеркивая пункты. Это «рецитирует» цели в конец контекста, где внимание модели максимально. LangChain в версии v0.7 (июль 2026) сделала TodoListMiddleware опциональным: тесты показали, что для коротких задач отключение туду-листа снижает стоимость и повышает награду, но для длинных многошаговых сценариев паттерн остается критически важным.

Механизм 4: Стратегия памяти между сессиями

Последний слой — персистентность. AWS AgentCore Memory хранит события и извлекает контекст в фоне, позволяя координатору вызывать инструмент recall в новой сессии. Claude Code после каждой компактизации перезагружает CLAUDE.md из корня проекта. Это превращает цель из «сообщения в истории», которое стареет и суммируется, в «изменяемый артефакт» на диске, который всегда свеж и короток.

Платформа/Инструмент Ключевая метрика или лимит Механизм работы
LangChain Deep Agents 20 000 токенов (ответы) Offloading на диск, структурированное суммирование с полями intent/artifacts
Claude Code 25 КБ / 200 строк (авто-память) Deferred loading схем, перезагрузка 5 последних файлов после компактизации
OpenAI Codex API /responses/compact Серверная компактизация с зашифрованным окном, передача его в следующий вызов
Manus ~50 вызовов на задачу Использование todo.md для рецитации целей в конец контекста
AWS AgentCore 3 субагента в MicroVM Параллельный сбор данных, возврат только структурированных выводов аналитику

Источник: MarkTechPost ↗