Внутри macOS 27 (Golden Gate), даже в бета-версии, скрывается инструмент, о котором большинство пользователей и даже многих технических специалистов, возможно, не подозревают. Это не просто фоновая служба, а полноценный CLI-интерфейс для работы с большими языковыми моделями (LLM), который работает прямо в терминале. Apple называет этот инструмент fm (Foundation Models). Он поставляется «из коробки», не требует установки сторонних решений вроде Ollama, LM Studio или MLX и предлагает разработчикам бесплатный, приватный endpoint для локального запуска ИИ.
На первый взгляд это звучит как революция: встроенный, безопасный и готовый к использованию ИИ-движок. Но как он работает на самом деле? Насколько он быстр? И самое главное — способен ли он использовать всю мощь топового железа Apple, такого как Mac Studio с чипом M3 Ultra, или же производительность упирается в какие-то скрытые ограничения? В этом разборе мы не просто запустим модель, а проведём глубокий технический анализ того, какие именно компоненты процессора задействованы, почему бенчмарки могут врать, и что это значит для выбора железа.
01Что такое fm и почему это важно для разработчика
Инструмент fm — это встроенный в операционную систему интерфейс командной строки, который позволяет запускать большие языковые модели локально на устройстве. Ключевое преимущество здесь — отсутствие необходимости в настройке окружения. Вам не нужно скачивать веса моделей, настраивать Python-окружения или управлять зависимостями. Как только вы устанавливаете macOS 27, инструмент уже доступен в терминале.
Для разработчика это открывает новые возможности. Вы можете скриптовать запросы к ИИ, строить над ним инструменты или интегрировать его в свои приложения. Важно отметить, что fm поддерживает два режима работы: локальный (on-device) и облачный (cloud). Облачный режим использует так называемый Private Cloud Compute — серверную инфраструктуру Apple, которая позволяет запускать более крупные модели, не ограничиваясь памятью вашего устройства. Однако в данном разборе нас интересует именно локальная часть, так как она демонстрирует реальные возможности аппаратного обеспечения Mac.
Сразу стоит оговориться: это бета-версия. Apple может изменить поведение инструмента, архитектуру или даже поддержку Intel-машинок (хотя, судя по всему, macOS 27 уже не поддерживает Intel, так как это новая архитектура, ориентированная на Apple Silicon). Тем не менее, текущие результаты дают четкое понимание того, как Apple оптимизирует свои ИИ-инференс-пайплайны.
02Проблема бенчмарков: почему стандартные инструменты не работают
Первым шагом в тестировании производительности ИИ обычно является запуск стандартных бенчмарков. Автор видео использовал популярный инструмент llama-bench, который предназначен для оценки скорости генерации токенов в LLM. Однако здесь возникла первая проблема: llama-bench ожидает совместимости с API OpenAI. Серверная часть fm от Apple, хотя и поддерживает некоторые стандарты (например, endpoint /models), не является полностью совместимой с OpenAI API. Она имеет свои собственные специфические ответы и структуру данных.

В результате стандартный бенчмарк выдал абсурдные цифры: 600 000 токенов в секунду для обработки промпта (prompt processing) и 22 000 токенов в секунду для декодирования (decode). Очевидно, что это ошибка измерения, а не реальная производительность. Причина в том, что llama-bench не может корректно интерпретировать тайминги, возвращаемые сервером Apple, так как формат ответов отличается от ожидаемого.
Это наглядный пример того, почему в области ИИ-инференса нельзя слепо доверять «коробочным» бенчмаркам, если вы работаете с нестандартными или проприетарными фреймворками. Apple, как и многие другие компании, строит свои собственные оптимизированные стеки, которые часто несовместимы с открытыми стандартами «из коробки».

03Собственный бенчмарк: как получить реальные цифры
Понимая, что стандартные инструменты не работают, автор создал собственный скрипт для тестирования — apple-fm-bench. Этот инструмент позволяет корректно измерять время обработки промпта и время генерации токенов (decode) напрямую через интерфейс fm. Результаты оказались гораздо более реалистичными:
- Обработка промпта (Prompt Processing): ~1150 мс (на Mac Mini M4 Pro).
- Генерация токенов (Decode): ~52 токена в секунду (на Mac Mini M4 Pro).
Эти цифры показывают, что локальная модель на Mac Mini M4 Pro работает довольно быстро для повседневных задач, но не является сверхбыстрой по сравнению с топовыми серверными решениями. Однако ключевой вопрос заключался не в абсолютных цифрах, а в том, как эти цифры масштабируются на более мощном железе.

04Архитектура инференса: Prompt Processing vs Decode
Чтобы понять, почему производительность не масштабируется линейно с мощностью чипа, нужно разобраться в двух этапах работы LLM:
- Prompt Processing (Pre-fill): Первый этап, на котором модель обрабатывает весь ваш запрос (промпт). Этот этап сильно зависит от пропускной способности памяти (Memory Bandwidth) и вычислительной мощности GPU, так как нужно загрузить все веса модели в память и выполнить матричные умножения для всего контекста сразу. Это «одноразовая» операция, которая занимает время, но не влияет на скорость появления каждого последующего слова.
- Decode (Generation): Второй этап, на котором модель генерирует ответ по одному токену за раз. На каждом шаге модель должна загрузить веса, вычислить следующий токен и сохранить его состояние. Этот этап повторяется для каждого слова в ответе. Он критически зависит от пропускной способности памяти, так как веса модели постоянно считываются из памяти, и от эффективности NPU (Neural Processing Unit), если модель оптимизирована под него.
Именно на этапе Decode пользователи замечают задержки. Если Decode медленный, текст появляется «по буквам» с паузами. Если Prompt Processing медленный, вы ждете начала ответа, но затем он идет быстро. Понимание этого различия важно для оптимизации: если вам важна скорость отклика на длинные запросы, нужен быстрый GPU. Если важна скорость генерации ответа — нужен эффективный NPU или оптимизированная память.

05Сравнение Mac Mini M4 Pro и Mac Studio M3 Ultra: Ожидания vs Реальность
Самый интригующий аспект теста — сравнение двух разных устройств Apple. С одной стороны, Mac Mini M4 Pro с чипом M4 Pro. С другой — Mac Studio M3 Ultra, который является топовым решением Apple на момент выхода видео. Разница в цене колоссальна: Mac Mini можно купить за ~$1000-1500 (в базовых конфигурациях), тогда как Mac Studio M3 Ultra стоит около $10 000.
Технические характеристики чипов:

- M4 Pro (в Mac Mini): Пропускная способность памяти — 273 ГБ/с. GPU оптимизирован для обработки промптов.
- M3 Ultra (в Mac Studio): Пропускная способность памяти — 819 ГБ/с. Это более чем в 3 раза быстрее, чем у M4 Pro. Ожидание было, что Mac Studio будет работать в 3 раза быстрее.
Однако результаты теста показали поразительное сходство. На Mac Mini M4 Pro скорость Decode составила ~56 токенов/с, а на Mac Studio M3 Ultra — те же ~52-56 токенов/с. Обработка промпта также была практически идентичной. Это означало, что огромная разница в пропускной способности памяти и мощности GPU не дает никакого прироста в скорости генерации токенов. Почему?
06Расследование: На чем на самом деле работает fm?
Автор предположил, что проблема кроется в Apple Neural Engine (ANE) — специализированном NPU в чипах Apple Silicon. Идея была проста: если ANE используется для инференса, то разница между M3 и M4 может быть минимальной, так как архитектура ANE в этих чипах очень похожа. Однако стандартные инструменты мониторинга (macOS Activity Monitor, сторонние утилиты like mac-top и htop) показывали 0% загрузки ANE, GPU и CPU во время работы fm. Это было невозможно, так как вычисления где-то происходили.

Автор проверил, работают ли вообще инструменты мониторинга. Запустив тест Core ML (который точно использует ANE), он увидел, что утилиты все равно показывают 0% загрузки, хотя скорость выполнения была в 2 раза выше при включенном ANE. Это указывало на то, что инструменты мониторинга просто не умеют корректно считывать загрузку NPU в новых версиях macOS или Apple изменила архитектуру отчетности.
07Эксперимент «Битва двигателей»: Как доказать, какой компонент используется
Поскольку инструменты мониторинга не работали, автор придумал элегантный эксперимент. Он запустил fm и одновременно начал «нагружать» один из компонентов системы (NPU или GPU) максимально возможной нагрузкой. Логика была следующей:

- Нагрузка на NPU: Если fm замедлится, значит, он тоже использует NPU и они конкурируют за ресурсы. Если нет — fm использует что-то другое.
- Нагрузка на GPU: Аналогично. Если fm замедлится, он использует GPU. Если нет — он использует NPU.
Результаты были однозначными:

- Когда автор нагружал Neural Engine, скорость генерации токенов (Decode) у fm падала. Обработка промпта (Prompt Processing) оставалась неизменной.
- Когда автор нагружал GPU, скорость обработки промпта (Prompt Processing) у fm падала. Генерация токенов (Decode) оставалась неизменной.
Это стало неопровержимым доказательством: fm использует Neural Engine для генерации токенов (Decode) и GPU для обработки промпта (Prompt Processing).
Именно поэтому Mac Studio M3 Ultra не быстрее Mac Mini M4 Pro. Оба чипа имеют одинаковую архитектуру Neural Engine, и именно он является «узким горлышком» для скорости генерации токенов в fm. Огромная пропускная способность памяти M3 Ultra и мощь его GPU остаются неиспользованными для этапа Decode, так как NPU не может использовать всю эту пропускную способность так же эффективно, как GPU в других фреймворках, или просто ограничен своей архитектурой.

08Почему Mac Studio M3 Ultra «бесполезен» для fm?
Вывод может показаться неожиданным: для работы со встроенным инструментом fm Mac Studio M3 Ultra не дает никакого преимущества перед Mac Mini M4 Pro. Вся дополнительная мощность Ultra-чипа (дополнительные ядра CPU, GPU, огромная память) остается «мертвым грузом» для этого конкретного инструмента, так как он жестко привязан к возможностям Neural Engine.
Это не значит, что Mac Studio плох. Он великолепен для других задач. Но если ваша единственная цель — запускать LLM через встроенный в macOS интерфейс fm, то переплата в $8000-9000 не имеет смысла. Mac Mini M4 Pro предлагает тот же опыт генерации текста за fraction of the price (долю цены).

Однако, если вы используете другие фреймворки, такие как MLX (родной фреймворк Apple для ИИ) или llama.cpp, ситуация меняется. Эти инструменты могут использовать всю мощь GPU и пропускную способность памяти. Например, MLX отлично масштабируется на M3 Ultra, позволяя запускать гораздо более крупные модели с высокой скоростью благодаря огромному объему и скорости памяти. fm же, судя по всему, использует более консервативную или оптимизированную под энергоэффективность стратегию, опирающуюся на NPU.
09Облачный режим Private Cloud Compute
Автор также протестировал облачный режим fm. Оказалось, что он работает примерно в 3 раза быстрее локального режима. Это логично, так как серверы Apple используют топовые чипы M-series Ultra или специализированные серверные решения с огромной пропускной способностью памяти и оптимизированными NPU.

Однако облачный режим имеет свои недостатки:
- Задержка (Latency): Сетевые задержки могут сделать ответ менее отзывчивым, особенно если сервер далеко.
- Приватность: Данные отправляются на серверы Apple. Хотя Apple заявляет о конфиденциальности, для некоторых корпоративных задач это может быть неприемлемо.
- Зависимость от интернета: Без подключения к сети облачный режим не работает.
Для разработчиков, которым нужна максимальная скорость и они готовы пожертвовать приватностью, облачный режим fm может быть отличным вариантом. Но для локальной разработки и тестирования локальный режим остается ключевым.

10Доступность в России и практическое применение
Для российских пользователей macOS 27 и инструмента fm есть несколько нюансов. Во-первых, бета-версии macOS доступны для загрузки через Apple Developer Program, который требует оплаты. Однако стабильные версии будут доступны всем. Во-вторых, функция Private Cloud Compute может быть недоступна в некоторых регионах из-за геоблокировки или юридических ограничений. Это нужно проверять индивидуально.
Что касается железа: Mac Mini M4 Pro доступен в РФ, но по ценам, значительно превышающим американские. Mac Studio с мощным чипом — редкость, часто заказывается под заказ с переплатой за доставку и таможню. Учитывая, что для fm разница в производительности между ними отсутствует, покупка Mac Studio для ИИ-задач в России становится еще менее оправданной с финансовой точки зрения. Mac Mini M4 Pro остается самым доступным и эффективным решением для запуска локальных ИИ-моделей через встроенный интерфейс.

Также стоит отметить, что Intel-машины не поддерживают macOS 27 и, следовательно, не могут использовать fm. Это окончательно закрывает эру Intel Mac для современных ИИ-задач, требующих доступа к Neural Engine. Если вы все еще используете Mac на Intel, для работы с ИИ вам придется использовать облачные решения или переходить на Apple Silicon.
11Выводы: кому что подойдёт
Резюмируя все вышесказанное, можно сделать следующие выводы:

- Для пользователей, которые хотят просто «попробовать» ИИ в macOS: Mac Mini M4 Pro с macOS 27 — идеальный выбор. Встроенный инструмент fm работает быстро, просто и не требует дополнительных настроек. Переплачивать за Mac Studio нет смысла.
- Для разработчиков, использующих MLX или llama.cpp: Mac Studio M3 Ultra или Mac Pro с M2 Ultra/M3 Ultra будут иметь огромное преимущество. Эти фреймворки используют всю мощь GPU и памяти, позволяя запускать огромные модели с высокой скоростью. fm же не раскрывает потенциал Ultra-чипов.
- Для тех, кому важна приватность: Локальный режим fm на Mac Mini M4 Pro обеспечивает отличный баланс между скоростью и безопасностью данных. Скорость в ~50 токенов/с достаточна для комфортной работы.
- Для тех, кому нужна максимальная скорость и не важна приватность: Облачный режим fm (Private Cloud Compute) работает в 3 раза быстрее локального. Это хороший вариант для тяжелых запросов, где важна скорость, а не конфиденциальность.
Главный урок этого теста: не все ИИ-инструменты одинаково используют железо. Apple оптимизирует fm под Neural Engine, что делает его быстрым на любом Mac, но не позволяет масштабироваться на Ultra-чипах. Если вы хотите использовать всю мощь Apple Silicon для ИИ, вам, возможно, придется использовать сторонние фреймворки, такие как MLX, а не встроенный в macOS интерфейс.
Будущее ИИ на Mac выглядит многообещающе, но пока мы находимся в стадии бета-тестирования. Apple может изменить архитектуру fm в будущих обновлениях, возможно, добавив поддержку GPU для этапа Decode или оптимизировав использование NPU. Но на данный момент Mac Mini M4 Pro — это король эффективности для встроенного ИИ.
12Дополнительные ресурсы
Автор видео предоставляет бесплатный инструмент apple-fm-bench на GitHub, который вы можете использовать для тестирования своего Mac. Также рекомендуется посмотреть другие видео автора о работе с MLX и llama.cpp, чтобы понять, как получить максимальную производительность от вашего Mac для ИИ-задач.
Не забудьте, что macOS 27 находится в бета-версии. Поведение инструмента fm может измениться. Следите за обновлениями Apple и тестами сообщества, чтобы быть в курсе последних изменений в ИИ-экосистеме macOS.
Источник: видео-разбор (YouTube) ↗
