Главная/Блог/Обзор/NVIDIA vs Apple Silicon: Тест скорости…
Обзор4 мин чтения · 8 июля 2026 г.

NVIDIA vs Apple Silicon: Тест скорости LLM (LLaMA 3)

Сравнение инференса LLaMA 3 на NVIDIA (RTX 4090, H100) и Apple Silicon (M2 Ultra, M3 Max). Реальные цифры токенов/с и VRAM из бенчмарков llama.cpp.

NVIDIA vs Apple Silicon: Тест скорости LLM (LLaMA 3)

Выбор железа для локального запуска больших языковых моделей (LLM) часто сводится к дилемме: мощные, но дорогие GPU NVIDIA или энергоэффективные чипы Apple Silicon. Мы проанализировали реальные данные бенчмарков GPU-Benchmarks-on-LLM-Inference, где тестировалась генерация 1024 токенов в модели LLaMA 3. Результаты показывают четкое разделение сфер применения: NVIDIA доминирует в скорости, а Apple Silicon предлагает уникальный баланс памяти и портативности.

01Скорость генерации (Tokens/Second)

Ключевой метрикой для пользователя является скорость генерации текста. В тестах использовалась сборка llama.cpp с оптимизациями BLAS. Ниже приведены данные по скорости генерации (не оценки промпта) для квантованных (Q4_K_M) и полноразрядных (F16) моделей.

Железо LLaMA 3 8B (Q4_K_M) LLaMA 3 70B (Q4_K_M) VRAM (прибл.)
H100 PCIe 80GB 144.49 25.01 80 GB
RTX 4090 24GB 127.74 OOM (Out of Memory) 24 GB
RTX 4090 24GB * 2 122.56 19.06 48 GB
RTX 4090 24GB * 4 117.61 18.83 96 GB
RTX 4090 24GB * 8 116.13 18.76 192 GB
M2 Ultra 192GB 76.28 12.13 192 GB
M3 Max 64GB 50.74 7.53 64 GB
M1 Max 64GB 34.49 4.09 64 GB

Как видно, H100 обеспечивает максимальную скорость, но для локального использования чаще применяются RTX 4090. Важно отметить: одна RTX 4090 (24 ГБ) не может запустить LLaMA 3 70B даже в квантовании Q4 из-за нехватки памяти (OOM). Для запуска 70B-моделей на NVIDIA требуется мульти-GPU конфигурация (минимум 2x4090 для Q4, 4x4090 для комфортной работы) или профессиональные карты типа A6000 (48GB) / H100 (80GB).

Apple M2 Ultra с 192 ГБ унифицированной памяти демонстрирует впечатляющие 76.28 токенов/с для 8B модели и 12.13 токенов/с для 70B. Это делает Mac Studio с M2 Ultra одним из самых доступных решений для запуска 70B-моделей «из коробки» без сложной настройки распределения по нескольким GPU.

⚠️
Важно. Для Apple Silicon доступно только ~70-78% унифицированной памяти для GPU. Например, на M1 Max с 32 ГБ памяти под модель можно выделить лишь около 22-25 ГБ. Для 64 ГБ и 192 ГБ версий это ограничение менее критично, но всегда учитывайте его при планировании загрузки.

02Скорость оценки промпта (Prompt Eval)

Если вы работаете с длинными контекстами, важна скорость обработки входных данных (prompt evaluation). Здесь разрыв между NVIDIA и Apple еще заметнее.

Железо LLaMA 3 8B (Q4_K_M) LLaMA 3 70B (Q4_K_M)
H100 PCIe 80GB 7760.16 984.06
RTX 4090 24GB 6898.71 OOM
RTX 4090 24GB * 8 9706.82 1336.26
M2 Ultra 192GB 1023.89 117.76
M3 Max 64GB 678.04 62.88

Одна RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B модели разница еще более драматична: 8x RTX 4090 выдают 1336 токенов/с на этапе оценки, тогда как M2 Ultra — всего 117.76. Это критично для приложений с длинными документами, где время ожидания первого токена (TTFT) напрямую влияет на UX.

03Сборка и запуск

Для получения этих результатов используется llama.cpp. Команды сборки и запуска просты, но требуют понимания флагов.

Сборка для NVIDIA (с поддержкой CUDA):

terminalbash
!make clean && LLAMA_CUBLAS=1 make -j

Сборка для Apple Silicon (Metal включен по умолчанию):

terminalbash
!make clean && make -j

Для принудительной загрузки всех слоев модели на GPU используется флаг -ngl 10000. Если вы хотите использовать только CPU, укажите -ngl 0.

💡
Совет. Если вы используете Apple Silicon и видите падение производительности, проверьте вывод терминала на строку recommendedMaxWorkingSetSize. Это подскажет, сколько памяти реально доступно GPU. Если модель не влезает, часть слоев будет выгружена в CPU-память, что резко снизит скорость.

04Какое железо кому подойдёт

Выбор зависит от бюджета и задач. Вот честная разбивка на основе данных:

  • Бюджетный энтузиаст (до 150-200 тыс. руб. за систему): RTX 4090 (24GB). Идеально для моделей до 13B-30B. Для 70B моделей придется либо мириться с медленным CPU-инференсом, либо собирать систему из 2-4 видеокарт, что дорого и сложно в охлаждении.
  • Профессиональный локальный сервер (высокий бюджет): 4x RTX 4090 или 2x RTX 6000 Ada (48GB). Это позволит запускать 70B модели с высокой скоростью (18-26 токенов/с). В РФ такие системы можно собрать самостоятельно, но аренда H100/A100 на RunPod часто выгоднее для эпизодических тяжелых задач.
  • Максимальная компактность и память (Mac Studio): M2 Ultra (192GB). Лучший выбор, если вам нужно запускать 70B-130B модели локально, но вы не готовы собирать сервер на 8 видеокартах. Скорость (12-13 токенов/с для 70B) достаточна для интерактивного общения, но не для высоконагруженных сервисов. M3 Max (64GB) хорош для 8B-30B моделей, но 70B в нем работает медленно (7.5 токенов/с) и с риском нехватки памяти.

В России купить новые H100/A100 сложно из-за санкций, поэтому основной рынок — это RTX 40-й серии и б/у профессиональные карты (A6000). Apple Silicon остается стабильным и доступным вариантом для работы с большими моделями благодаря унифицированной памяти.

Источник: источник (тест/офиц. документация) ↗