Проблема: «Слепое» извлечение информации
Традиционные системы долговременной памяти для AI-агентов работают по принципу «выбрать-сохранить-извлечь». Главная проблема такого подхода заключается в том, что при извлечении данных система не проверяет, не противоречат ли новые факты старым, не устарели ли они или не были ли отозваны. Это приводит к генерации противоречивых или ложных утверждений на основе «мертвых» записей.
Решение: GPM и битемпоральная модель
Автор предлагает Governed Persistent Memory (GPM) — аудируемую модель переходов состояний с привязкой к источнику (source-bound admission). Система использует пять исполняемых правил, которые гарантируют целостность журнала, изоляцию конфликтов и запрет на повторное использование удаленных или отозванных данных. Ключевая особенность — семантика «fail-closed» (отказ в обслуживании при ошибке), что исключает выдачу непроверенной информации.
Результаты бенчмарка GPM-ReleaseBench
В ходе тестирования на наборе из 3,600 случаев (GPM-ReleaseBench) система продемонстрировала абсолютную точность. Для сравнения, даже самая сильная из трех простых политик обработки смогла корректно обработать только половину нарушений. Ниже приведены ключевые метрики сравнения управляемой и неуправляемой версий:
| Метрика / Версия | Результат | Примечание |
|---|---|---|
| GPM (полная корректность) | 3,600 / 3,600 | 100% совпадений с эталоном |
| Сильнейшая простая политика | 1,800 / 3,600 | 50% ошибок в случаях нарушений |
| GPM (V3 arm, sealed eval) | 2,400 / 2,400 | 100% корректных кластеров |
| Qwen2.5-7B (ungoverned) | 600 / 2,400 | Базовая модель без GPM |
Исправление ошибок LLM
Наиболее впечатляющий результат получен в закрытой оценке сервиса: управляемая ветка GPM (V3) достигла 100% корректности (2,400/2,400), в то время как неуправляемая локальная модель Qwen2.5-7B справилась лишь с 25% задач (600/2,400). Важно отметить, что GPM не просто показала лучшую точность, а полностью исправила все 1,800 базовых ошибок Qwen2.5-7B без единой регрессии. Статистическая достоверность подтверждена односторонними 95% доверительными интервалами (99.875% и 99.834%).
Масштабируемость и формальная верификация
Дальнейшие тесты (V5) с привязкой к дате генерации и разделением на китайские и английские команды также показали 100% результат (2,400/2,400). Кроме того, автор провел формальную проверку конечной модели, исследовав 331,776 семантических и 1,990,656 запросных состояний без нахождения контрпримеров. Тестирование на 100,000 трасс с тремя движками также дало нулевое количество расхождений.
- Дата публикации: 12 августа 2026 года.
- Объем работы: 23 страницы, 2 рисунка, 11 таблиц.
- Ключевой вывод: GPM обеспечивает детерминированность и надежность, необходимые для долгосрочных агентов, устраняя фундаментальные недостатки стандартных подходов к хранению памяти.
Источник: arXiv cs.AI ↗
