Релиз модели15 августа 2026 г., 22:30 МСК🤖 Auto

Meta Muse Glimmer: 30B-модель для локальных AI-агентов на NVIDIA

Meta выпустила плотную модель Muse Glimmer (30B параметров) с контекстом 120K+, оптимизированную для локального запуска AI-агентов на GPU NVIDIA. Производительность достигает 20K токенов/сек на Blackwell Ultra.

Баннер новости 5863

Плотная архитектура против MoE для стабильности

Meta представила Muse Glimmer — модель с 30 миллиардами параметров и окном контекста более 120 000 токенов. В отличие от популярных моделей с архитектурой Mixture-of-Experts (MoE), Muse Glimmer использует плотную структуру (dense), где каждый токен обрабатывается всеми параметрами. Это устраняет накладные расходы на маршрутизацию и обеспечивает предсказуемую задержку, высокую надежность следования инструкциям и стабильность в длинных многошаговых сценариях, что критично для автономных агентов.

Производительность на NVIDIA Blackwell Ultra

Модель оптимизирована для работы на различных платформах NVIDIA, от настольных GPU до edge-устройств. На архитектуре NVIDIA Blackwell Ultra при точности BF16/NVF4 достигается пропускная способность свыше 20 000 токенов в секунду на один GPU. Это позволяет запускать «всегда включенных» агентов локально, без необходимости шардирования модели или использования CPU offloading.

Платформа NVIDIA Ключевые характеристики Сценарий использования
GeForce RTX 5090 32 GB VRAM, 5-е поколение Tensor Cores Локальная разработка, защита проприетарного кода
DGX Spark Высокая производительность, NVLink, NIM-контейнеры Рабочие станции, enterprise-пайплайны
DGX Station Rack-scale Blackwell Ultra On-prem решения, air-gap, строгая комплаенс-политика
Jetson Edge-вычисления Робототехника, промышленная автоматизация

Инструментарий и развертывание

Для работы с Muse Glimmer NVIDIA предлагает несколько путей:

  • NVIDIA NIM: Готовые оптимизированные контейнеры для быстрого развертывания.
  • SGLang и vLLM: Open-source решения для разработчиков, требующих глубокого контроля над производительностью.
  • NemoClaw: Фреймворк для создания долгосрочных агентов (генерация кода, поддержка) в безопасной среде OpenShell.
  • NeMo AutoModel: Библиотека для тонкой настройки (SFT, LoRA) и обучения с подкреплением (RL) прямо на GPU NVIDIA.

Почему это важно

Выпуск Muse Glimmer закрывает нишу надежных локальных моделей для агентов. Благодаря размеру в 30B параметров, модель помещается в VRAM одного современного GPU (например, RTX 5090), что исключает необходимость в облачных эндпоинтах. Это решает проблемы конфиденциальности данных (личные файлы, креды, проприетарный код) и снижает операционные расходы, так как inference происходит полностью on-device.

Источник: NVIDIA dev blog ↗