Проблема: парадокс парафразов
В продакшене LLM-приложений (чат-боты, RAG-пайплайны) тысячи запросов семантически идентичны, но формулируются по-разному. Традиционные стеки обрабатывают каждый вариант как новый запрос, что ведет к переплате. Даже prefix-caching (кэширование префиксов) лишь снижает стоимость обработки входных токенов, но не отменяет сам вызов модели и декодирование ответа. LangCache решает эту проблему, кэшируя готовый ответ и сопоставляя новые запросы с уже обработанными по смыслу через векторный поиск.
Как это работает: архитектура и метрики
Сервис работает по принципу двух вызовов REST API. При поступлении запроса приложение сначала отправляет его в LangCache для генерации эмбеддинга и поиска похожих записей. Если найдено совпадение с заданным порогом сходства, ответ возвращается из кэша без обращения к LLM. Если совпадения нет, запрос идет в модель, а результат сохраняется в кэш для будущих запросов. По умолчанию используются встроенные модели эмбеддингов, но поддерживается и bring-your-own-model.
Экономия и скорость: цифры из практики
Redis заявляет о сокращении затрат на API до 90% и ускорении ответов при попадании в кэш до 15 раз. В демонстрационном запуске на парафразированном запросе прямое обращение к модели заняло 2,232 секунды, тогда как ответ из кэша был получен за 0,37 секунды (ускорение в 6 раз). Ключевая экономия достигается за счет исключения стоимости выходных токенов (output tokens). Формула расчета экономии проста: Стоимость выходных токенов × Частота попаданий в кэш (hit rate).
| Метрика | Прямой вызов LLM | Redis LangCache (Hit) | Эффект |
|---|---|---|---|
| Время ответа | 2,232 сек | 0,37 сек | Ускорение ~6x |
| Входные токены | 514 | 0 | Экономия на входе |
| 250 | 0 | Экономия на выходе | |
| Затраты на API | Полная стоимость | Минимальная (эмбеддинг) | До 90% экономии |
Безопасность и управление
Критический аспект семантического кэширования — настройка порога сходства (threshold). Слишком низкий порог может привести к выдаче некорректных ответов (например, политика возврата вместо информации об обновлении тарифа). LangCache предлагает инструменты для контроля: TTL (время жизни), политики вытеснения, изоляция данных между клиентами и мониторинг в консоли Redis Cloud. Данные хранятся на серверах клиента, Redis не использует их для обучения моделей.
Доступность
Redis LangCache доступен в публичной превью-версии на платформе Redis Cloud. Интеграция осуществляется через REST API, а также SDK для Python и JavaScript. Сервис совместим с любыми провайдерами LLM и языками программирования.
Источник: MarkTechPost ↗
