Исследования14 августа 2026 г., 10:18 МСК🤖 Auto

Governed Persistent Memory: как GPM исправляет 100% ошибок Qwen2.5-7B

Исследователь Guodong Xu представил Governed Persistent Memory (GPM) — систему с битемпоральной семантикой, которая обеспечивает 100% корректность ответов в долгосрочной памяти агентов, полностью исправляя провалы базовой модели Qwen2.5-7B.

Баннер новости 5779

Проблема: «Слепое» извлечение информации

Традиционные системы долговременной памяти для AI-агентов работают по принципу «выбрать-сохранить-извлечь». Главная проблема такого подхода заключается в том, что при извлечении данных система не проверяет, не противоречат ли новые факты старым, не устарели ли они или не были ли отозваны. Это приводит к генерации противоречивых или ложных утверждений на основе «мертвых» записей.

Решение: GPM и битемпоральная модель

Автор предлагает Governed Persistent Memory (GPM) — аудируемую модель переходов состояний с привязкой к источнику (source-bound admission). Система использует пять исполняемых правил, которые гарантируют целостность журнала, изоляцию конфликтов и запрет на повторное использование удаленных или отозванных данных. Ключевая особенность — семантика «fail-closed» (отказ в обслуживании при ошибке), что исключает выдачу непроверенной информации.

Результаты бенчмарка GPM-ReleaseBench

В ходе тестирования на наборе из 3,600 случаев (GPM-ReleaseBench) система продемонстрировала абсолютную точность. Для сравнения, даже самая сильная из трех простых политик обработки смогла корректно обработать только половину нарушений. Ниже приведены ключевые метрики сравнения управляемой и неуправляемой версий:

Метрика / Версия Результат Примечание
GPM (полная корректность) 3,600 / 3,600 100% совпадений с эталоном
Сильнейшая простая политика 1,800 / 3,600 50% ошибок в случаях нарушений
GPM (V3 arm, sealed eval) 2,400 / 2,400 100% корректных кластеров
Qwen2.5-7B (ungoverned) 600 / 2,400 Базовая модель без GPM

Исправление ошибок LLM

Наиболее впечатляющий результат получен в закрытой оценке сервиса: управляемая ветка GPM (V3) достигла 100% корректности (2,400/2,400), в то время как неуправляемая локальная модель Qwen2.5-7B справилась лишь с 25% задач (600/2,400). Важно отметить, что GPM не просто показала лучшую точность, а полностью исправила все 1,800 базовых ошибок Qwen2.5-7B без единой регрессии. Статистическая достоверность подтверждена односторонними 95% доверительными интервалами (99.875% и 99.834%).

Масштабируемость и формальная верификация

Дальнейшие тесты (V5) с привязкой к дате генерации и разделением на китайские и английские команды также показали 100% результат (2,400/2,400). Кроме того, автор провел формальную проверку конечной модели, исследовав 331,776 семантических и 1,990,656 запросных состояний без нахождения контрпримеров. Тестирование на 100,000 трасс с тремя движками также дало нулевое количество расхождений.

  • Дата публикации: 12 августа 2026 года.
  • Объем работы: 23 страницы, 2 рисунка, 11 таблиц.
  • Ключевой вывод: GPM обеспечивает детерминированность и надежность, необходимые для долгосрочных агентов, устраняя фундаментальные недостатки стандартных подходов к хранению памяти.

Источник: arXiv cs.AI ↗