Смена стратегии: от Open Weights к Платформе
Meta Superintelligence Labs представила Muse Spark 1.1 — мультимодальную модель рассуждений, предназначенную для выполнения агентных задач. Ключевое отличие от предыдущих релизов Meta: модель является закрытой (closed weights), хостится на серверах Meta и доступна исключительно через Meta Model API. Это знаменует переход компании от стратегии открытого распространения весов к построению собственной облачной платформы, конкурирующей с AWS Bedrock и Google Vertex AI.
API спроектирован с учетом совместимости: он поддерживает протоколы, совместимые с OpenAI и Anthropic, что позволяет разработчикам переключаться на Muse Spark, изменив только базовый URL в коде, без переписывания логики приложения.
Технические характеристики и возможности
Модель поддерживает контекстное окно объемом 1 000 000 токенов (в документации API указано 1 048 576). Уникальная особенность — встроенный механизм compaction (сжатия контекста): модель самостоятельно управляет окном, сохраняя важные действия и извлекая информацию из ранних этапов сессии, что критично для долгих агентов.
Основные функции API включают:
- Адаптивные рассуждения: возможность регулировать уровень «размышлений» модели (reasoning effort) в каждом запросе.
- Мультимодальность: входные данные — текст, изображения, видео, документы; выход — текст.
- Агентные инструменты: параллельный вызов инструментов (parallel tool calling), Files API, кэширование промптов и интеграция с web_search для получения ответов с цитированием.
- Структурированный вывод: поддержка JSON-схем для надежного парсинга ответов.
Бенчмарки: Лидерство в агентах, отставание в коде
Meta опубликовала результаты тестирования Muse Spark 1.1 в сравнении с Opus 4.8, GPT-5.5 и Gemini 3.1 Pro. Модель демонстрирует явное превосходство в задачах использования инструментов (tool use) и рассуждений с их применением, но уступает лидерам в чистой генерации кода.
| Бенчмарк | Тест | Muse Spark 1.1 | Opus 4.8 (max) | GPT-5.5 (xhigh) | Gemini 3.1 Pro (high) |
|---|---|---|---|---|---|
| MCP Atlas | Scaled tool use | 88.1 | 82.2 | 75.3 | 78.2 |
| JobBench | Professional tool use | 54.7 | 48.4 | 38.3 | 15.9 |
| Humanity’s Last Exam | Reasoning with tools | 62.1 | 57.9 | 52.2 | 51.4 |
| OSWorld-Verified | Computer use | 80.8 | 83.4 | 78.7 | 76.2 |
| SWE-Bench Pro | Real-repo coding | 61.5 | 69.2 | 58.6 | 54.2 |
| DeepSWE 1.1 | Long-horizon coding | 53.3 | 59.0 | 67.0 | 12.0 |
| BabyVision | Visual reasoning | 76.3 | 81.2 | 83.6 | 51.4 |
Ценообразование и доступность
На момент запуска Meta Model API доступен в публичном превью только для пользователей в США. Доступ для пользователей из ЕС пока не открыт.
- Для разработчиков: $1.25 за 1 млн входных токенов и $4.25 за 1 млн выходных токенов. Новые аккаунты получают $20 бесплатных кредитов.
- Для потребителей: Бесплатный доступ в режиме «Thinking» через приложение Meta AI и сайт meta.ai.
Практическое применение: Агенты и автоматизация
Модель позиционируется как оркестратор. Она умеет делегировать задачи параллельным субагентам, адаптироваться к изменениям контекста в реальном времени и обобщать знания на новые инструменты (zero-shot generalization) без дообучения. Демонстрационные кейсы включают автоматизацию листингов на Facebook Marketplace (анализ видео -> публикация) и отладку веб-приложений через скриншоты.
Для интеграции достаточно использовать стандартный Python-клиент OpenAI, указав новый базовый URL:
client = OpenAI(
base_url="https://api.meta.ai/v1",
api_key=os.environ["MODEL_API_KEY"]
)Бенчмарки
| Бенчмарк | Muse Spark 1.1 | GPT-5.5 (xhigh) | Gemini 3.1 Pro (high) | Opus 4.8 (max) |
|---|---|---|---|---|
| MCP Atlas | 88.1% | 75.3% | 78.2% | 82.2% |
| JobBench | 54.7% | 38.3% | 15.9% | 48.4% |
| Humanity’s Last Exam | 62.1% | 52.2% | 51.4% | 57.9% |
| OSWorld-Verified | 80.8% | 78.7% | 76.2% | 83.4% |
| SWE-Bench Pro | 61.5% | 58.6% | 54.2% | 69.2% |
| DeepSWE 1.1 | 53.3% | 67% | 12% | 59% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
