Суть проблемы: кэш исчез бесследно
Пользователи AWS Bedrock столкнулись с аномалией: при отправке идентичных промптов к одной и той же модели искусственного интеллекта с интервалом в доли секунды, система перестала возвращать кэшированные ответы. Вместо мгновенного получения результата из памяти, запросы стали проходить полную обработку, что привело к резкому увеличению времени отклика (latency) и, как следствие, к росту стоимости использования сервиса.
Почему это критично для разработчиков
Кэширование в AWS Bedrock — это не просто оптимизация скорости, а ключевой механизм контроля затрат. Многие приложения отправляют повторяющиеся запросы (например, в чат-ботах или системах поддержки). Отсутствие кэша означает:
- Рост расходов: Пользователи платят за токены дважды за один и тот же запрос.
- Нестабильность производительности: Время ответа варьируется от миллисекунд до секунд, что нарушает SLA (соглашения об уровне обслуживания).
- Отсутствие прозрачности: AWS не отправлял никаких уведомлений о техническом сбое или изменении конфигурации кэширования.
Детали инцидента
Исследование, опубликованное в Towards AI, демонстрирует кейс, где два идентичных вызова модели, отправленных с разницей в 0,3 секунды, обрабатывались по-разному. Ожидалось, что второй запрос будет обработан мгновенно благодаря кэшу, но вместо этого система выполнила полную генерацию ответа. Это указывает на то, что механизм кэширования был либо отключен, либо нарушен на уровне инфраструктуры, причем без предупреждения клиентов.
Что делать?
Разработчикам, использующим AWS Bedrock, рекомендуется:
- Мониторить задержки ответов в реальном времени.
- Проверять метрики использования кэша через CloudWatch.
- Рассмотреть альтернативные решения для кэширования на стороне приложения, если критична предсказуемость затрат и скорости.
Инцидент подчеркивает важность прозрачности со стороны провайдеров облачных AI-сервисов и необходимости внедрения дополнительных слоев контроля для независимой валидации работы кэширования.
Источник: Towards AI pub ↗
