Конец эры «избыточных» ресурсов
AWS официально начала борьбу с «расходом процессорного времени» (CPU waste) среди внутренних инженеров. В мае компания провела встречи, на которых потребовала сократить неэффективное использование инстансов EC2. Раньше разработчики могли свободно запускать виртуальные машины для веб-инфраструктуры с низкой загрузкой CPU, но теперь доступ к ним стал дефицитом. Один из сотрудников отметил, что ожидание инстанса растягивается на дни, что является беспрецедентной ситуацией даже для ветеранов Amazon.
Сдвиг парадигмы: от GPU к CPU
Причина кризиса — переход к агентному ИИ (Agentic AI). Традиционно соотношение GPU к CPU в дата-центрах составляло 4:1 или 8:1, где процессор лишь «подкармливал» ускорители. Однако агенты требуют сложной оркестрации и выполнения вызовов инструментов (tool calls) непосредственно на CPU. Это вывело процессоры в центр внимания, сделав их более востребованными, чем когда-либо.
Цифры и технологии
Ситуация усугубляется инцидентами с перерасходом средств. В прошлом месяце один AI-агент для кодинга потратил $1,8 млн токенов, превысив бюджет на 860%. AWS использует в своих инстансах процессоры AMD, Intel и собственную архитектуру Graviton5 на базе ARM, которая на данный момент является самой мощной в линейке компании.
| Параметр | Традиционная архитектура (Inference) | Агентная архитектура (Agentic AI) |
|---|---|---|
| Основная нагрузка | GPU (инференс) | Смешанная (CPU + GPU) |
| Роль CPU | Подача данных на GPU | Оркестрация, вызовы инструментов |
| Соотношение GPU:CPU | 4:1 или 8:1 | Стремится к 1:1 |
Рынок реагирует
Производители процессоров активно капитализируют этот спрос. AMD представила серверные чипы Zen 6 «Venice», впервые запустив новую архитектуру для дата-центров раньше клиентского рынка. Nvidia также сместила фокус с акселераторов на свой новый CPU Vera. Несмотря на острый дефицит, проблема касается в основном spot-инстансов: контрактная мощность (contracted capacity) остается стабильной.
Источник: Tom's Hardware ↗
