Релиз модели10 августа 2026 г., 17:46 МСК🤖 Auto

Meta выпустила Muse Glimmer 30B: локальный AI-агент для Mac и ПК

Meta Superintelligence Labs открыла веса модели Muse Glimmer 30B под лицензией Apache 2.0. Модель оптимизирована для работы на потребительских GPU с 24–32 ГБ памяти, поддерживая агентные задачи, кодинг и мультимодальность.

Баннер новости 5444

Локальный AI-агент на 30 млрд параметров

Meta представила Muse Glimmer — новую модель с 30 миллиардами параметров, специально разработанную для работы в качестве локальных AI-агентов. В отличие от большинства современных LLM, требующих облачной инфраструктуры, Muse Glimmer спроектирована для запуска на обычных ПК и Mac с одной потребительской видеокартой. Модель открыта под лицензией Apache 2.0, что позволяет свободно использовать её в коммерческих и личных проектах.

Архитектура и обучение: от дистилляции до RL

Модель обучалась в три этапа, чтобы сбалансировать мощность и ограничения локального железа:

  • Pre-Training: Использование логит-дистилляции на выходах модели Muse Spark с аналогичным набором данных.
  • Mid-Training: Дообучение на данных с длинным контекстом и сложными цепочками рассуждений (reasoning traces).
  • Post-Training: Комбинация supervised fine-tuning (SFT), он-полосной дистилляции и reinforcement learning (RL) в областях кодинга, рассуждений и агентных задач.

Ключевые возможности для агентов

Muse Glimmer заточена под автономное выполнение задач. Среди основных функций:

  • End-to-End Agentic Task Completion: Успешное прохождение бенчмарков DeepSearch QA, MCP-Atlas, τ-Bench и SWE-Bench.
  • Reliable Tool Use: Точное вызов функций (function calling) с соблюдением схем в длительных воркфлоу.
  • Failure Recovery: Способность диагностировать ошибки инструментов и перезапускать действия без остановки агента.
  • Multimodal Input: Поддержка интерлированного текста и изображений через выделенный энкодер восприятия.
  • Controllable Effort: Настройка уровня рассуждений для баланса между скоростью и качеством.

Оптимизация для 24 ГБ VRAM

Главное техническое достижение — возможность запуска модели на GPU с 24–32 ГБ памяти. Для этого применены две технологии:

  1. Квантование: Веса сжаты до ~4-битной точности, занимая менее 20 ГБ. Это оставляет место для KV-cache, энкодера изображений и модели-драфтера.
  2. Speculative Decoding (DFlash): Легковесная модель-драфтер предлагает блоки токенов, которые основная модель проверяет параллельно. Это значительно ускоряет генерацию без потери качества.

Сравнение производительности

Meta оценила Muse Glimmer в категории моделей до 30 млрд параметров. Ниже приведены ключевые метрики на бенчмарках агентных задач (данные Meta):

Бенчмарк Описание Результат Muse Glimmer 30B
SWE-Bench Решение задач по программированию (fixing bugs) Сильные показатели в своем классе (конкретные % в отчете)
τ-Bench Многошаговые агентные задачи Высокая успешность завершения задач
MCP-Atlas Использование инструментов (Model Context Protocol) Точное соблюдение схем вызовов
DeepSearch QA Поиск и ответ на вопросы Конкурентоспособные результаты

Для сравнения, полноразмерная модель на 30 млрд параметров требовала бы более 55 ГБ памяти. Квантованная версия (K-Quant-17GB) работает на MacBook M4-Max/M5-Max и RTX 5090 с задержкой, достаточной для fluid conversation (плавного диалога).

Где скачать и как запустить

Веса модели доступны на Hugging Face. Поддержка интегрируется в популярные инструменты:

  • Inference: llama.cpp, MLX, ExecuTorch, Ollama, LM Studio, Unsloth.
  • Serving: vLLM, SGLang.
  • Cloud/Edge: Together AI, Fireworks AI, OpenRouter.

Meta также работает с AMD, Arm, Dell, Intel и NVIDIA над оптимизацией производительности на различных устройствах. Документация для разработчиков уже доступна на AI Developer Center.

Источник: Meta ↗