Проблема: отсутствие «четвертого примитива» в AI-инфраструктуре
Инфраструктура ИИ опирается на три commodity-примитива: вычисления (NVIDIA), модели (weights) и поиск (vector DB). Однако для долгосрочных агентов (long-horizon agents) критически не хватает четвертого элемента — долговременной памяти с семантикой жизненного цикла. Существующие решения (RAG, MemGPT) часто не справляются с устареванием данных, сложными многошаговыми связями и верификацией фактов.
Команда AutoTrustAI представила PaperGuru — первую систему, реализующую формализованную концепцию Lifecycle-Aware Memory (LAM). Архитектура базируется на четырех аксиомах:
- Версионирование контента: система понимает, когда утверждение становится неактуальным (stale) после ревизии или отмены статьи.
- Структурная релевантность: поиск идет не по косинусному сходству, а по графу цитирования (два шага вглубь).
- Ограниченная стоимость запроса: скорость работы не падает при росте архива.
- Провенанс: каждое утверждение агента имеет четкую ссылку на источник.
Архитектура: Capital Chunk Memory (CCM)
В основе PaperGuru лежит механизм Capital Chunk Memory (CCM), который разделяет память на два уровня:
- Chunk heads: компактные маршрутизируемые заголовки (по одному на артефакт).
- Chunk contents: необработанный текст, загружаемый лениво (on-demand).
Центральный индекс поддерживает temporal artifact graph с двумя типами связей: структурными (cites, implements) и историко-причинными (deprecated-by, retracted-by). Пайплайн работы строится по схеме: Search → Extract → Reason → Verify, где этап Reason использует цикл Compose/Critique/Mutate для генерации черновиков с проверкой доказательств.
Результаты: State-of-the-Art на PaperBench и SurveyBench
PaperGuru показал выдающиеся результаты на двух самых строгих бенчмарках. На PaperBench (воспроизведение кода по статьям от OpenAI, 2025) система превзошла человеческий базовый уровень (ML-PhD, 41%) на 25 процентных пунктов. На SurveyBench (написание обзоров) улучшена как содержательная часть, так и структурное богатство (фигуры, таблицы, код).
Сравнение метрик
| Бенчмарк | Метрика | PaperGuru | Лучший базовый уровень | Прирост (Lift) |
|---|---|---|---|---|
| PaperBench (OpenAI, 2025) | Среднее воспроизведение (20 статей) | 65.95% | 35.74% | +30.21% |
| PaperBench | Статьи выше порога PhD (41%) | 20 / 23 | 4 / 23 | +16 статей |
| SurveyBench (Yan et al., 2025) | Content score (5 осей) | 94.66% | 80.60% | +14.06% |
| SurveyBench | Composite richness (фигуры/таблицы/код) | 43.76% | 20.36% | +23.40% |
Детализация по SurveyBench
В задаче написания обзоров PaperGuru демонстрирует преимущество в структурном богатстве. В отличие от базовых моделей (AutoSurvey, SurveyForge), которые часто генерируют текст без ссылок на источники или визуализаций, PaperGuru обеспечивает 2x рост доли контента, подкрепленного артефактами (фигуры, таблицы, код). Это измерение проводилось на уровне файловой системы, что исключает влияние субъективности LLM-судей.
Значение для индустрии
Успех PaperGuru подтвержден не только бенчмарками, но и практикой: с Q4 2025 года 10 статей, подготовленных с использованием этой системы, были приняты в топовые конференции (FSE 2026, ICML 2026, TOSEM). Это доказывает, что переход от плоского RAG к семантически осознанной памяти жизненного цикла является ключом к созданию надежных агентов для научных и инженерных задач.
Источник: Github ↗
