Проблема: «Мертвый» контекст
Основная проблема современных LLM-агентов заключается не в потере контекста, а в его неактуальности. Контекстное окно работает как транскрипт: оно фиксирует прошлое, но не сигнализирует, если факты изменились. В исследовании приведен классический пример:
- 10:00 — Цена на рейс A составляет $420.
- 10:01 — Агент планирует бронирование по этой цене.
- 10:03 — Цена резко возрастает до $610.
- 10:04 — Агент все равно пытается выполнить бронирование по старому плану, так как в контексте все еще записана цена $420.
В отличие от систем, которые просто «забывают» старую информацию, этот агент уверенно движется к провалу, опираясь на данные, которые перестали быть верными три минуты назад. Это не ошибка памяти, это ошибка валидации реальности.
Методология: Чистый Python без LLM
Автор отказался от использования реальных моделей (API) для бенчмарка, чтобы исключить шум от качества промптов или сбоев провайдера. Были созданы два детерминированных исполнителя (state machines) на чистом Python:
- Baseline Executor: Выполняет следующий шаг плана, не проверяя актуальность зависимостей. Ошибка обнаруживается только в момент провала действия.
- Validity-Aware Executor: Перед действием проверяет статус зависимости. Если факт невалиден, агент немедленно перепланирует маршрут, не тратя ресурсы на заведомо провальное действие.
Классификация состояний фактов
Вместо бинарной логики (истина/ложь) введена система из четырех состояний, что позволяет агенту принимать более тонкие решения. Особое внимание уделено разделению фактической и операционной невалидности:
| Состояние | Описание | Пример |
|---|---|---|
| ACTIVE | Текущие данные подтверждают факт. | Цена товара актуальна. |
| STALE | Факт был верен, но появились новые данные. | Цена изменилась, но система еще не обновила кэш. |
| SUPERSEDED | Новое наблюдение полностью заменило старое. | Вышла новая версия ПО, старая документация устарела. |
| UNKNOWN | Недостаточно данных для оценки. | База данных недоступна, но количество записей не изменилось (операционная невалидность). |
Ключевые выводы и метрики
Эксперимент с 96 конфигурациями опроверг первоначальную гипотезу автора о том, что форма графа зависимостей является главным драйвером потерь. Оказалось, что ключевым фактором является размер задачи.
Агент с «слоем валидации» демонстрирует значительное преимущество в условиях ограниченных ресурсов (token budget, время выполнения). Baseline-исполнитель тратит шаги на действия, которые были обречены на провал еще до их начала, что приводит к исчерпанию бюджета и неудаче всей задачи. Валидационный слой позволяет избежать этих «мертвых» шагов, перенаправляя вычислительные ресурсы на перепланирование.
Почему это важно для индустрии
Это решение не заменяет методы сжатия контекста или улучшения поиска (RAG). Оно закрывает специфическую нишу: временную неконсистентность. Пока большинство систем борются с тем, чтобы «вместить» больше информации или найти нужную, эта архитектура учит систему понимать, что информация, находящаяся в окне, может быть физически или логически непригодна для использования в текущий момент времени.
Источник: Towards Data Science ↗
