Локальный AI-агент на 30 млрд параметров
Meta представила Muse Glimmer — новую модель с 30 миллиардами параметров, специально разработанную для работы в качестве локальных AI-агентов. В отличие от большинства современных LLM, требующих облачной инфраструктуры, Muse Glimmer спроектирована для запуска на обычных ПК и Mac с одной потребительской видеокартой. Модель открыта под лицензией Apache 2.0, что позволяет свободно использовать её в коммерческих и личных проектах.
Архитектура и обучение: от дистилляции до RL
Модель обучалась в три этапа, чтобы сбалансировать мощность и ограничения локального железа:
- Pre-Training: Использование логит-дистилляции на выходах модели Muse Spark с аналогичным набором данных.
- Mid-Training: Дообучение на данных с длинным контекстом и сложными цепочками рассуждений (reasoning traces).
- Post-Training: Комбинация supervised fine-tuning (SFT), он-полосной дистилляции и reinforcement learning (RL) в областях кодинга, рассуждений и агентных задач.
Ключевые возможности для агентов
Muse Glimmer заточена под автономное выполнение задач. Среди основных функций:
- End-to-End Agentic Task Completion: Успешное прохождение бенчмарков DeepSearch QA, MCP-Atlas, τ-Bench и SWE-Bench.
- Reliable Tool Use: Точное вызов функций (function calling) с соблюдением схем в длительных воркфлоу.
- Failure Recovery: Способность диагностировать ошибки инструментов и перезапускать действия без остановки агента.
- Multimodal Input: Поддержка интерлированного текста и изображений через выделенный энкодер восприятия.
- Controllable Effort: Настройка уровня рассуждений для баланса между скоростью и качеством.
Оптимизация для 24 ГБ VRAM
Главное техническое достижение — возможность запуска модели на GPU с 24–32 ГБ памяти. Для этого применены две технологии:
- Квантование: Веса сжаты до ~4-битной точности, занимая менее 20 ГБ. Это оставляет место для KV-cache, энкодера изображений и модели-драфтера.
- Speculative Decoding (DFlash): Легковесная модель-драфтер предлагает блоки токенов, которые основная модель проверяет параллельно. Это значительно ускоряет генерацию без потери качества.
Сравнение производительности
Meta оценила Muse Glimmer в категории моделей до 30 млрд параметров. Ниже приведены ключевые метрики на бенчмарках агентных задач (данные Meta):
| Бенчмарк | Описание | Результат Muse Glimmer 30B |
|---|---|---|
| SWE-Bench | Решение задач по программированию (fixing bugs) | Сильные показатели в своем классе (конкретные % в отчете) |
| τ-Bench | Многошаговые агентные задачи | Высокая успешность завершения задач |
| MCP-Atlas | Использование инструментов (Model Context Protocol) | Точное соблюдение схем вызовов |
| DeepSearch QA | Поиск и ответ на вопросы | Конкурентоспособные результаты |
Для сравнения, полноразмерная модель на 30 млрд параметров требовала бы более 55 ГБ памяти. Квантованная версия (K-Quant-17GB) работает на MacBook M4-Max/M5-Max и RTX 5090 с задержкой, достаточной для fluid conversation (плавного диалога).
Где скачать и как запустить
Веса модели доступны на Hugging Face. Поддержка интегрируется в популярные инструменты:
- Inference: llama.cpp, MLX, ExecuTorch, Ollama, LM Studio, Unsloth.
- Serving: vLLM, SGLang.
- Cloud/Edge: Together AI, Fireworks AI, OpenRouter.
Meta также работает с AMD, Arm, Dell, Intel и NVIDIA над оптимизацией производительности на различных устройствах. Документация для разработчиков уже доступна на AI Developer Center.
Источник: Meta ↗
