Агент с «памятью» и постоянными процессами
Muse Code — это не просто чат-бот для кода, а полноценный терминальный агент для macOS и Linux. Ключевое архитектурное отличие от аналогов: использование набора асинхронных фоновых агентов, которые остаются активными на протяжении всей сессии. Это позволяет избежать избыточного сбора информации при каждом новом запросе, снижая задержки и улучшая управление сложными многошаговыми задачами.
Все действия модели (вызовы, запуск инструментов, утверждения, правки) записываются в локальный журнал событий (append-only event log). Meta называет этот подход «replay-exact» и «restart-safe»: при сбое системы агент может возобновить работу с того самого места, где остановился, что критично для длительных задач.
Модель Muse Spark 1.2: обучение через практику
В основе агента лежит модель Muse Spark 1.2. В отличие от предыдущей версии, она была специально дообучена совместно с инструментарием Muse Code (co-training). Обучение включало:
- Long-horizon training: работа с целыми репозиториями и крупными проектами.
- Self-improvement: модель 1.1 генерировала сложные задачи, а 1.2 училась их решать, создавая масштабируемый датасет.
- Оптимизация контекста: использование планирования, условных целей и сжатия контекста для удержания прогресса.
Результаты бенчмарков
Meta опубликовала специфическую методологию оценки, сравнивая Muse Spark 1.2 с Grok 4.5, Claude Opus 5, GPT-5.6 Terra, Gemini 3.6 Flash и Kimi K3. Тесты проводились в изолированных облачных песочницах Daytona. Ниже приведены ключевые метрики на основных наборах данных:
| Бенчмарк | Описание | Результат Muse Spark 1.2 |
|---|---|---|
| Terminal-Bench 2.1 | 89 задач, pass@1 (5 попыток) | Значительно выше, чем 80.0 у версии 1.1 |
| DeepSWE v1.1 | 113 задач, 91 репозиторий, 5 языков | Высокая точность в end-to-end воркфлоу |
| Meta Internal Coding Bench | 440 задач на основе реальных PR | Лидирующие позиции в сравнении с конкурентами |
Кейс: оптимизация GPU-ядер за 24 часа
Наиболее впечатляющим примером применения стала задача оптимизации GPU-ядер NVIDIA Hopper. Muse Spark 1.2 выполнил более 1000 вызовов инструментов в течение 24 часов. Модель самостоятельно писала, компилировала и профилировала код, улучшая производительность ядер KDA и MLA (Multi-Head Latent Attention) по сравнению с базовыми реализациями FLA Triton и PyTorch. Это демонстрирует способность агента к долгосрочному автономному исследованию и инженерным решениям.
Доступность и установка
На данный момент Muse Code доступен в бета-версии для macOS и Linux. Загрузка осуществляется через скрипт:
curl -fsSL https://dev.meta.ai/install.sh | bash
Модель Muse Spark 1.2 также доступна через Meta Model API. Ссылки на скачивание весов (weights) не предоставлены, что указывает на модель SaaS-зависимости на старте. Встроенные навыки включают /plan (создание плана), /grill (стресс-тест плана) и /goal (выполнение цели).
Источник: MarkTechPost ↗
