Проблема: «Плоский текст» убивает долгосрочных агентов
При развертывании LLM-агентов их поведение часто управляется внешним контекстом — набором инструкций, которые обновляются по мере накопления опыта. Однако традиционный подход использует «плоский» текстовый файл системных инструкций. По мере роста этого файла инструкции начинают конфликтовать друг с другом, а верификация изменений становится невозможной из-за комбинаторного взрыва взаимодействий. Это приводит к деградации производительности агента в долгосрочной перспективе (long-horizon).
Решение: GRACE и семантические графы
Авторы Dan C. Hsu и Luke Lu предлагают метод Graph-Regularized Agentic Context Evolution (GRACE). Вместо куска текста система хранит инструкции как типизированный семантический граф. Обновления валидируются локально — в окрестностях конкретных узлов графа, что делает проверку изменений предсказуемой и безопасной. Принятые изменения затем реконструируются в виде инкрементальных правок текстового чекпоинта, используемого при деплое.
Результаты: Превосходство над SOTA-моделями
Эксперименты проводились на фиксированном телеком-агенте (на базе бенчмарка τ²-bench) с контролируемым сдвигом распределения (distribution shift). Ключевая метрика — pass³ (строгая надежность). GRACE позволил модели Gemini 2.5 Flash превзойти даже более мощную Gemini 3.1 Pro в условиях долгосрочной эволюции контекста.
| Метрика / Модель | Значение (pass³) | Примечание |
|---|---|---|
| GRACE (Gemini 2.5 Flash) | 0.673 ± 0.136 | Финальный чекпоинт, 5 репликаций |
| Flat-text HCE (Baseline) | 0.191 ± 0.051 | Традиционный плоский текст |
| Gemini 3.1 Pro (Zero-shot) | 0.242 | Ссылка на held-out наборе |
| Gemini 2.5 Flash (Zero-shot) | 0.091 | Исходная точка без эволюции |
Почему это важно
Результаты демонстрируют два критических требования для создания надежных агентов: структурная основа (граф), делающая верификацию локальной, и механизм консолидации, сохраняющий инструкции читаемыми для модели. GRACE показывает, что правильная архитектура данных может компенсировать разрыв в «силе» самой модели, делая эволюцию агентов безопасной и масштабируемой.
Источник: arXiv cs.AI ↗
