В мире локальных больших языковых моделей (LLM) и edge-вычислений часто возникает вопрос: что важнее — чистая вычислительная мощность или объем и пропускная способность памяти? В новом видео рассматривается сравнение трех мощных платформ, каждая из которых обладает 128 ГБ единой памяти (Unified Memory), но при этом кардинально различается по цене, энергопотреблению и архитектурному назначению. Это NVIDIA Jetson Thor, платформа Spark (на базе чипа GB10) и Apple Mac Mini M4 Pro.
На первый взгляд, выбор кажется очевидным: Thor стоит более чем на тысячу долларов дешевле Spark, но предлагает тот же объем памяти. Однако, как показывает практика, «дешевле» не всегда значит «лучше для конкретной задачи». Разница в архитектуре процессора, GPU, NPU и, что критически важно, в типе памяти и ее пропускной способности, создает совершенно разные профили производительности. Мы разберем, как эти машины справляются с разными типами моделей — от разреженных (Mixture of Experts) до плотных (Dense), и почему для одних задач Thor идеален, а для других Spark оставляет его далеко позади.
011. Введение: Почему 128 ГБ и почему эти три устройства?
Ключевым фактором, объединяющим NVIDIA Jetson Thor, платформу Spark и Apple Mac Mini M4 Pro, является не только объем оперативной памяти, но и ее пропускная способность. Все три платформы заявляют пропускную способность памяти на уровне 273 ГБ/с. В контексте работы с большими языковыми моделями, особенно при загрузке весов моделей в память, это критически важный параметр. Однако, как мы увидим далее, одинаковая цифра пропускной способности не означает одинаковой эффективности из-за различий в процессорах, шинах данных и архитектуре взаимодействия CPU-GPU.
Важно отметить, что Jetson Thor был предоставлен автору для тестирования компанией NVIDIA, в то время как Spark и Mac Mini были приобретены самостоятельно. Это позволяет избежать предвзятости в оценке аппаратных ограничений. Кроме того, в рамках обзора упоминается раздача Jetson Orin Nano Super, подписанного Дженсеном Хуангом, что подчеркивает актуальность и интерес сообщества к данным устройствам.
Для практического применения важно понимать, что эти устройства предназначены для разных сценариев. Mac Mini M4 Pro — это универсальная рабочая станция для разработчиков и энтузиастов. Spark позиционируется как высокопроизводительное решение для burst-задач (всплесков вычислений). Jetson Thor, в свою очередь, разработан для детерминированных приложений, таких как робототехника и автономные системы, где важна стабильность задержек, а не максимальная пиковая скорость.
022. Энергопотребление: Тихий фон против мощного вычислителя
Первое, что бросается в глаза при запуске систем, — это разница в энергопотреблении. Даже в состоянии простоя, когда открыт только терминал, различия существенны. Mac Mini M4 Pro потребляет около 8 Вт. Jetson Thor — около 31 Вт. Spark, в свою очередь, потребляет около 44 Вт. Это уже задает тон: Spark — самое «прожорливое» устройство, но и самое мощное.

Под нагрузкой, при запуске моделей, эта разница становится еще более очевидной. При тестировании модели Minestrel 3 (разреженная модель, Mixture of Experts) Mac Mini потреблял около 70 Вт, Thor — около 90 Вт, а Spark — почти 141 Вт. Это почти двукратное превышение энергопотребления Spark по сравнению с Thor. Для локальных серверов, работающих 24/7, это критический фактор. Thor, будучи более энергоэффективным, может быть предпочтительнее для задач, требующих постоянной работы, в то время как Spark лучше подходит для периодических, но интенсивных вычислений.
033. Архитектурные различия: CPU, GPU и NPU
Несмотря на то, что все три системы построены на базе ARM-архитектуры, детали реализации чипов кардинально различаются. Thor использует 4-нанометровый процесс для части CPU, в то время как Spark использует 3-нанометровый процесс. Эта разница в техпроцессе напрямую влияет на эффективность коммуникации между CPU и GPU. Более новый техпроцесс у Spark позволяет ему быстрее передавать данные в GPU, что объясняет его превосходство в задачах, требующих интенсивного взаимодействия процессора и графического ускорителя.
Важно также отметить, что Thor и Spark базируются на архитектуре NVIDIA Blackwell. Thor имеет 25 больше CUDA-ядер, чем предыдущее поколение AGX Orin. Однако Spark, вероятно, имеет больше Tensor Core и CUDA Core в целом, что и обеспечивает его превосходство в чистых вычислениях. Mac Mini M4 Pro, используя Apple Silicon, полагается на свои собственные Neural Engine и GPU, которые оптимизированы для работы с macOS и специфическими фреймворками, но уступают NVIDIA в чистых вычислениях для LLM, особенно в части pre-fill.
044. Тестирование на разреженных моделях (Mixture of Experts): Minestrel 3
Для начала тестирования была выбрана новая модель Minestrel 3, которая является разреженной моделью (Sparse Model) или Mixture of Experts (MoE). В таких моделях не все параметры активны одновременно; система выбирает только подмножество параметров, необходимых для генерации ответа. Это делает такие модели более эффективными по скорости и потреблению памяти.

Тестирование проводилось с использованием Ollama с флагом verbose. Задача заключалась в генерации детальной архитектуры для e-commerce платформы. Результаты показали, что Mac Mini и Spark выдают практически идентичные результаты по скорости генерации токенов: 39 токенов/с для Mac и 34.97 токенов/с для Spark. Thor оказался немного медленнее — 30.82 токена/с.
Однако, если посмотреть на утилизацию GPU, можно заметить интересную картину. Spark демонстрирует стабильную утилизацию GPU на уровне 95%. Thor же показывает колебания от 94% до 96%, что указывает на то, что модель загружается и выгружается из памяти с высокой частотой. Это может свидетельствовать о меньшей эффективности управления памятью в Thor для данного конкретного типа задачи, хотя и не влияет критически на итоговую скорость.
055. Скорость обработки промпта (Prompt Eval): Где Thor и Spark сияют
Скорость обработки промпта (prompt eval rate) отвечает за то, как быстро система анализирует ваш запрос и контекст чата. Это этап, не зависящий напрямую от пропускной способности памяти в той же мере, что и генерация, и больше зависящий от чистой вычислительной мощности CPU и GPU.

В тесте с Minestrel 3 результаты были следующими: - Mac Mini M4 Pro: 353 токена/с. - NVIDIA Jetson Thor: 1036 токенов/с. - Spark: 2406 токенов/с.
Spark оказался быстрее Mac Mini более чем в 6 раз, а Thor — в 3 раза. Это огромное преимущество для Spark. Даже после обновления до M5, Mac Mini, вероятно, не сможет догнать Spark в этом показателе. Thor, в свою очередь, показывает отличные результаты, уступая Spark, но значительно опережая Apple Silicon. Это делает Thor отличным выбором для задач, где важна быстрая реакция на длинные промпты, например, при анализе больших документов.
066. Тестирование на плотных моделях (Dense Models): Llama 3.3 70B
Плотные модели (Dense Models), такие как Llama 3.3 70B, используют все свои параметры для каждого токена. Это делает их более точными и подходящими для сложных задач, таких как кластеризация или глубокий анализ, но значительно более медленными. Модель Llama 3.3 70B занимает более 40 ГБ на диске и требует значительного объема памяти для загрузки весов и контекста.
При запуске этой модели на Mac Mini M4 Pro (с 64 ГБ памяти) система была практически заполнена, так как модель требует около 40-45 ГБ для весов плюс контекст. Thor и Spark, имея 128 ГБ, справились с задачей без проблем. Результаты генерации токенов для Llama 3.3 70B были следующими: - Mac Mini: 5.43 токена/с. - Thor: 4.61 токена/с. - Spark: 4.46 токена/с.

Здесь мы видим эффект убывающей отдачи. Несмотря на то, что Spark имеет более мощное железо, его скорость генерации для плотных моделей лишь незначительно отличается от Thor и даже Mac Mini. Это связано с тем, что при плотных моделях узким местом становится не вычислительная мощность, а пропускная способность памяти и объем VRAM. Все три системы упираются в ограничения памяти, поэтому разница в скорости генерации минимальна.
Однако, скорость обработки промпта (pre-fill) для Llama 3.3 70B снова показала превосходство Spark: 283 токена/с против 103 токена/с у Thor и 34 токена/с у Mac Mini. Это подтверждает, что Spark оптимизирован для быстрой обработки больших объемов данных перед генерацией.
077. Тестирование с llama-bench: Глубокий анализ производительности
Для более точного измерения производительности был использован инструмент llama-bench, входящий в состав llama.cpp. Этот инструмент позволяет отдельно измерить скорость pre-fill (обработка промпта) и token generation (генерация ответа). Были протестированы модели Llama 3.3 70B (Q4_K_M) и GPT-oss 20B (MoE).

При тестировании Llama 3.3 70B с llama-bench результаты подтвердили данные Ollama. Spark показал 4.56 токена/с для генерации и 283 токена/с для pre-fill. Thor показал 4.4 токена/с для генерации и 130 токенов/с для pre-fill. Mac Mini показал 5.48 токена/с для генерации и 42 токена/с для pre-fill. Интересно, что Mac Mini оказался немного быстрее в генерации плотных моделей, возможно, благодаря оптимизации памяти Apple.
При тестировании разреженной модели GPT-oss 20B (120B параметров) разница между Thor и Spark стала еще более очевидной. Spark показал 52.77 токена/с для генерации и 977 токенов/с для pre-fill. Thor показал 37.17 токена/с для генерации и 464 токена/с для pre-fill. Spark оказался быстрее более чем в 2 раза по обоим показателям. Это объясняется тем, что Spark имеет больше Tensor Core и CUDA Core, что критично для MoE-моделей.
088. Практическое применение и доступность в РФ
Для российского пользователя выбор между этими устройствами осложнен логистикой и санкциями. Mac Mini M4 Pro можно приобрести через параллельный импорт, хотя цены могут быть выше мировых. Spark и Jetson Thor — это специализированные устройства NVIDIA, которые могут быть сложнее в получении. Jetson Thor позиционируется как платформа для разработчиков, что может облегчить его покупку через официальные дистрибьюторы NVIDIA в РФ, если они существуют. Spark, вероятно, доступен через OEM-партнеров или специализированных поставщиков edge-вычислений.
Важно учитывать, что для работы с LLM на этих устройствах потребуется настройка окружения. Для NVIDIA устройств это CUDA и cuDNN. Для Apple Silicon — Metal и оптимизированные сборки llama.cpp. Ollama поддерживает все три платформы, что упрощает запуск моделей. Однако, для достижения максимальной производительности, особенно на Spark, может потребоваться компиляция llama.cpp с поддержкой CUDA и оптимизациями для GB10.

099. Выводы: Кому что подойдёт
Итак, подведем итоги. Все три устройства обладают 128 ГБ памяти и пропускной способностью 273 ГБ/с, но их производительность и назначение различаются.
- Apple Mac Mini M4 Pro: Лучший выбор для универсальных задач, разработки ПО и работы с плотными моделями, где важна стабильность и интеграция с экосистемой Apple. Он потребляет меньше всего энергии, но уступает NVIDIA в скорости обработки промптов. Идеален для тех, кто ценит тишину и компактность.
- NVIDIA Jetson Thor: Отличный баланс между производительностью и энергопотреблением. Идеален для задач, требующих детерминированной задержки, таких как робототехника, автономные системы и локальные серверы LLM, работающие 24/7. Он значительно дешевле Spark и предлагает хорошую скорость обработки промптов.
- Spark (GB10): Самый мощный и самый энергозатратный. Идеален для burst-задач, где требуется максимальная скорость обработки больших объемов данных и генерации токенов. Если вам нужна максимальная производительность для MoE-моделей и вы не ограничены в бюджете и охлаждении, Spark — ваш выбор.
В конечном счете, выбор зависит от ваших конкретных задач. Если вы строите локальный сервер для чат-бота, Thor может быть оптимальным. Если вы проводите исследования и вам нужна максимальная скорость, Spark будет лучше. Если вы разработчик, ценящий удобство и тишину, Mac Mini M4 Pro останется надежным выбором.
Тестирование показывает, что архитектура и тип модели играют решающую роль. Не существует «лучшего» устройства для всех задач. Понимание различий между плотными и разреженными моделями, а также между pre-fill и generation, поможет вам сделать осознанный выбор и получить максимальную отдачу от ваших инвестиций в локальные LLM.
Источник: видео-разбор (YouTube) ↗
