Архитектура и железо
Исследователи обнаружили, что Meta запускает своих AI-агентов Muse на серверах с процессорами AMD EPYC 9D25 (архитектура Turin). В отличие от типичных GPU-кластеров для генерации ответов, агенты работают в изолированных песочницах на чистом CPU. Каждая такая среда (sandbox) выделяет пользователю:
- 2 виртуальных ядра (vCPU)
- 8 ГБ оперативной памяти
- ОС: Ubuntu 24.04
- Ядро: Linux 7.0
Инференс (генерация текста) происходит на отдельных GPU-серверах, а агенты лишь управляют логикой и выполняют команды в своих CPU-песочницах.
Масштабирование и экономика
По данным аналитиков, Meta Muse уже преодолела отметку в 500 000 ежедневных активных пользователей (DAU). При использовании двухпроцессорных серверных плат (trays) с чипами EPYC 9D25, каждая из которых поддерживает до 512 vCPU и 2 ТБ памяти, один сервер может обслуживать до 256 пользователей Muse.
Для обеспечения работы текущего трафика Meta, вероятно, использует около 2 000 серверных стоек. Это демонстрирует высокую эффективность архитектуры Turin в задачах массового мульти-тенантного исполнения агентов.
Безопасность и риски
Агенты имеют доступ к терминалу Ubuntu и могут выполнять базовые команды для сбора информации о системе. Однако исследователи отмечают потенциальные уязвимости:
- Агент предложил настроить SSH-доступ к своей приватной VM, что открывает путь для атак типа reverse SSH tunnel.
- Команды с правами sudo заблокированы, но изоляция контейнеров может быть не идеальной.
- Существует риск обхода файрволов через инициацию соединения от имени агента.
Сводные характеристики среды
| Параметр | Значение |
|---|---|
| Процессор хоста | AMD EPYC 9D25 (Turin) |
| Память на пользователя | 8 ГБ |
| Ядра на пользователя | 2 vCPU |
| Операционная система | Ubuntu 24.04 (Linux 7.0) |
| Наличие GPU в песочнице | Нет (инференс вынесен) |
| Активные пользователи (DAU) | > 500 000 |
Доступность
Сервис доступен как приложение для Android, iOS и macOS, а также через браузер для пользователей с аккаунтом Meta. Использование CPU-песочниц вместо GPU-кластеров для каждого агента может стать новым стандартом для экономичного масштабирования AI-ассистентов в будущем.
Источник: Tom's Hardware ↗
