Исследования17 сентября 2026 г., 18:19 МСК🤖 Auto

Контекстное гниение: почему AI-агенты ломаются на длинных данных

Тестирование 18 передовых моделей в Chroma показало: производительность падает задолго до достижения лимита контекста. Проблема, названная «контекстным гниением», угрожает всем AI-агентам.

Баннер новости 7722

Суть проблемы: падение качества до лимита

Лаборатория Chroma провела масштабное тестирование 18 передовых языковых моделей (LLM), подвергая их воздействию всё более длинных входных данных. Результаты оказались однозначными: каждая протестированная модель демонстрировала деградацию качества ответов задолго до того, как достигала своего заявленного лимита контекста. Это явление получило название «контекстное гниение» (Context Rot).

Проблема заключается не в техническом переполнении буфера, а в том, что модель начинает «терять нить» повествования или игнорировать важные детали из середины длинного контекста, снижая точность и релевантность ответов.

Ключевые метрики и детали теста

Исследование выявило, что деградация носит нелинейный характер. В начале обработки длинного текста модель работает стабильно, но по мере увеличения объема входных данных (например, при добавлении новых документов в векторную базу или истории диалога) качество падает. Это критично для AI-агентов, которые полагаются на долгосрочную память и работу с большими объемами данных.

Почему это важно для разработчиков

Для создателей AI-агентов, использующих RAG (Retrieval-Augmented Generation) или долгосрочную память, «контекстное гниение» означает, что простое увеличение лимита токенов не решает проблему. Если не внедрять механизмы фильтрации, сжатия или переупорядочивания контекста, агенты будут становиться менее надежными по мере роста объема данных, с которыми они работают.

  • Масштаб теста: 18 frontier-моделей.
  • Наблюдение: Деградация качества до достижения технического лимита контекста.
  • Вывод: Необходимы новые подходы к управлению контекстом в AI-агентах.

Источник: Towards AI pub ↗