Исследования28 сентября 2026 г., 10:21 МСК🤖 Auto

Контекстное гниение: почему рост окна ухудшает агентов и удваивает затраты

Исследование выявило феномен «контекстного гниения» (context rot): увеличение окна контекста не только снижает точность LLM-агентов, но и экспоненциально увеличивает вычислительные расходы на механизм внимания.

Баннер новости 8402

Проблема масштабируемости внимания

Новое исследование, опубликованное в Towards AI, вскрывает критическую проблему при работе с длинными контекстами в современных больших языковых моделях (LLM). Оказывается, простое увеличение контекстного окна не приводит к линейному улучшению качества ответов. Напротив, наблюдается эффект, названный авторами "context rot" (контекстное гниение). Это не резкий спад качества, а постепенный градиент ухудшения, который имеет четкую архитектурную причину.

Экспоненциальный рост стоимости

Одной из самых серьезных проблем является экономическая сторона. Исследование показывает, что стоимость вычислений механизма внимания (attention mechanism) растет непропорционально увеличению объема данных. Если стандартная сложность внимания часто оценивается как квадратичная относительно длины контекста, то на практике удвоение окна контекста может привести к увеличению затрат на внимание в 4 раза. Это делает обработку длинных документов или длительных сессий диалога экономически неэффективной без оптимизации архитектуры.

Почему "контекстная инженерия" не спасает

Авторы отмечают, что популярные методы "context engineering" (оптимизация структуры промптов, сжатие истории, выборочное сохранение ключевых фрагментов) перестают быть эффективным решением по мере роста окна. Модель начинает "терять" важные детали в глубине контекста, игнорируя их в пользу более свежих или поверхностных паттернов. Это приводит к тому, что агент становится менее точным, несмотря на наличие всей необходимой информации в доступном окне.

Архитектурные последствия

Феномен "контекстного гниения" указывает на необходимость пересмотра архитектурных решений. Вместо бесконечного расширения окна контекста, разработчикам стоит сосредоточиться на:

  • Моделях с эффективной обработкой длинных последовательностей (например, использующих sparse attention или ретривер-механизмы).
  • Гибридных подходах, где контекст динамически фильтруется до отправки в модель.
  • Оптимизации самих механизмов внимания для снижения квадратичной сложности.

Что это значит для разработчиков AI-агентов

Для команд, создающих автономных AI-агентов, это исследование служит предупреждением: слепое увеличение контекстного окна — тупиковый путь. Необходимо внедрять системы управления памятью агента, которые будут не просто хранить историю, но и активно структурировать и сжимать её, чтобы минимизировать эффект "гниения" и контролировать затраты на inference.

Источник: Towards AI pub ↗