Исследования15 июля 2026 г., 11:17 МСК🤖 Auto

Cost-Governed RAG: Как TurboVec устранил скрытые расходы в мульти-тенантных LLM

Исследователь Navnit Shukla представил архитектуру Cost-Governed RAG, которая позволяет точно атрибутировать затраты на поиск и генерацию для каждого клиента, снижая инфраструктурные расходы до 9x.

Баннер новости 3613

Проблема невидимой субсидии в RAG

Корпоративные системы RAG (Retrieval-Augmented Generation) сталкиваются с критическим пробелом в управлении затратами. В то время как стоимость генерации токенов LLM четко тарифицируется, слой извлечения (retrieval) — включая векторную память, вычисления сходства и вызовы API эмбеддингов — остается общим нераспределенным расходом. Это приводит к невидимой кросс-субсидии: один клиент может использовать больше ресурсов поиска, но платить меньше, чем тот, кто генерирует длинные ответы, что искажает реальную экономику сервиса.

Решение: TurboVec и детерминированная атрибуция

Автор предлагает архитектуру Cost-Governed RAG, интегрирующую шлюз управления мульти-тенантными LLM с новым индексом TurboVec. Ключевое отличие TurboVec — использование «codebook-oblivious» (независящей от кодовой книги) квантования. Это позволяет применять детерминированную формулу памяти с замкнутым контуром, что делает расчет затрат на поиск для каждого клиента практически точным. В отличие от графовых индексов с нелинейными накладными расходами, этот подход исключает утечку данных через общие кодовые книги и обеспечивает прозрачность.

Результаты тестирования

Система была развернута в среде Snowpark Container Services. Тестирование проводилось на симуляции 100 клиентов с базой из 10 миллионов векторов (лог-нормальное распределение размеров). Результаты демонстрируют высокую эффективность:

Метрика Значение / Эффект
Точность атрибуции затрат 99.96%
Накладные расходы на телеметрию Ниже 0.04% от времени запроса
Снижение стоимости инфраструктуры поиска В 3.1–9.0 раз по сравнению с управляемыми векторными БД

Почему это важно

Представленная работа формализует трехуровневую модель затрат, позволяя бизнесу видеть полную картину стоимости RAG-пайплайна. Внедрение таких систем критично для провайдеров LLM-as-a-Service, которым необходимо справедливо распределять расходы между клиентами без потери производительности. Архитектура доказывает, что точный учет затрат на поиск технически реализуем и экономически выгоднее традиционных управляемых решений.

Источник: arXiv cs.AI ↗