Агентный подход: от генерации к долгосрочным задачам
Muse Spark 1.3 — это четвертая версия линейки Muse Spark за пять месяцев. В отличие от предыдущих религов, ориентированных на однократную генерацию, новая модель спроектирована для long-horizon agentic work (долгосрочных агентных задач). Ключевые улучшения касаются способности модели удерживать контекст в длинных диалогах, самостоятельно собирать информацию из противоречивых источников и корректно реагировать на тупиковые ситуации, запрашивая уточнения у пользователя вместо галлюцинаций.
Экономия ресурсов: цифры от Meta
Для агентных сценариев критически важны стоимость и скорость. Meta сообщает, что по сравнению с версией 1.2, Muse Spark 1.3 использует на 20% меньше вызовов инструментов (tool calls) и на 25% меньше токенов. Это напрямую снижает стоимость выполнения сложных задач в продакшене. Модель поддерживает контекстное окно до 1 миллиона токенов.
Бенчмарки: победа в SWE и MRCR
В внутренних тестах Meta AI модель показала результаты выше, чем у конкурентов из семейства GPT-5.6 и Claude Opus 5. Особо выделяется работа с длинным контекстом (MRCR), где разрыв с GPT-5.6 Sol составляет более 20 пунктов.
| Бенчмарк | Muse Spark 1.3 (max) | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE v1.1 | 75.4 | 74.0 | 72.7 |
| SWE-Atlas Codebase QnA | 59.4 | — | — |
| Terminal-Bench 2.1 | 88.8 (tie) | 86.7 | 88.8 |
| MRCR v2 (256K–512K) | 98.5 | — | 91.5 |
| MRCR v2 (512K–1M) | 98.1 | — | 73.8 |
Важно отметить, что в таблице приведены результаты для режима max (максимальное рассуждение), который на данный момент закрыт для публичного доступа. Доступная версия xhigh оценивается Artificial Analysis на 61 балл в Intelligence Index, что сопоставимо с GPT-5.6 Sol (max) и Grok 4.6 (high).
Доступность и цены
Модель уже доступна в продукте Muse Code и через Meta Model API. Самостоятельно развернуть веса (self-host) нельзя — они закрыты. Meta анонсировала выпуск open-weight версии в будущем, но пока она в roadmap.
Тарификация осталась прежней:
- $1.25 за 1 млн входных токенов.
- $4.25 за 1 млн выходных токенов.
- Существует сниженный тариф для контрибьюторов: $0.10 / $0.20.
Режим max пока находится на стадии дополнительного тестирования безопасности, поэтому разработчики в продакшене используют режим xhigh.
Бенчмарки
| Бенчмарк | Muse Spark 1.3 | Muse Spark 1.3 (256K–512K) | Muse Spark 1.3 (512K–1M) | Muse Spark 1.3 (max) | Muse Spark 1.3 (xhigh) | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Sol (256K–512K) | GPT-5.6 Sol (512K–1M) |
|---|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 75.4% | — | — | — | — | 74% | 72.7% | — | — |
| Terminal-Bench 2.1 | 88.8% | — | — | — | — | 86.7% | 88.8% | — | — |
| MRCR v2 | — | 98.5% | 98.1% | — | — | — | — | 91.5% | 73.8% |
| OSWorld 2.0 | — | — | — | 66.9% | 57.2% | — | — | — | — |
| Tau3-Bench Banking | — | — | — | 52% | 47% | — | — | — | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
