Проблема классического RAG
Традиционные системы Retrieval-Augmented Generation (RAG) решают задачу быстрого поиска, но страдают от фундаментального недостатка: они не запоминают. Каждая сессия начинается с чистого листа, что приводит к дублированию усилий, потере контекста и, как следствие, к галлюцинациям при попытке системы «додумать» отсутствующую информацию. Автор статьи утверждает, что для создания надежных AI-приложений необходим переход от простого извлечения к накоплению знаний.
Архитектура Persistent Knowledge Layer (PKL)
Предложенная архитектура — это вендор-независимый blueprint, реализованный на стеке Microsoft Azure. Ключевая идея заключается в разделении ответственности: система не просто ищет документы, она формирует и обновляет структурированное понимание предметной области. Основные компоненты решения:
- Microsoft Foundry: Используется для оркестрации и управления жизненным циклом данных.
- Azure AI Search: Отвечает за высокопроизводительный полнотекстовый и векторный поиск.
- Cosmos DB: Выступает в роли persistent-хранилища для структурированных знаний и метаданных, обеспечивая долговечность информации между сессиями.
- FastAPI: Обеспечивает легковесный API-слой для взаимодействия с фронтендом и другими сервисами.
Практическая реализация на примере страхования
Для демонстрации эффективности подхода автор применил архитектуру к корпусу данных в сфере имущественного страхования (property insurance). В отличие от стандартного RAG, где модель может выдать общий ответ на основе похожих документов, PKL позволяет системе опираться на ранее накопленные и верифицированные факты. Это критически важно в доменах, где цена ошибки высока, а точность формулировок имеет решающее значение.
Почему это важно для разработчиков
Предложенный подход меняет парадигму проектирования AI-приложений. Вместо того чтобы бороться с галлюцинациями на уровне промптов, разработчики могут внедрить слой, который физически не позволяет системе гадать, если у нее нет подтвержденных данных. Это снижает затраты на валидацию ответов и повышает доверие пользователей к автоматизированным системам поддержки и аналитики.
Источник: Towards Data Science ↗
