Главная/Блог/Обзор/NVIDIA vs Apple Silicon: скорость…
Обзор4 мин чтения · 5 сентября 2026 г.

NVIDIA vs Apple Silicon: скорость инференса LLM

тест токен/с разных NVIDIA GPU и Apple Silicon (M-серии) на моделях 7B-70B через llama.cpp

NVIDIA vs Apple Silicon: скорость инференса LLM

Выбор аппаратной платформы для локального запуска больших языковых моделей (LLM) — это всегда поиск компромисса между стоимостью, энергоэффективностью и пропускной способностью памяти. В последние годы на рынке сформировалось два явных лидера: серверные видеокарты NVIDIA, доминирующие в индустрии, и чипы Apple Silicon (M1/M2/M3), предлагающие уникальную архитектуру унифицированной памяти.

Чтобы объективно сравнить эти решения, мы проанализировали результаты бенчмарков, проведенных с использованием llama.cpp. Тестирование охватывало модели LLaMA 3 различных размеров (8B и 70B) с разными квантованиями (Q4_K_M и F16). В качестве полигона использовались как облачные инстансы RunPod (NVIDIA), так и локальные устройства: 13-дюймовый MacBook Air (M1), 14-дюймовый MacBook Pro (M1 Max), Mac Studio (M2 Ultra) и 16-дюймовый MacBook Pro (M3 Max).

01Ключевые метрики: Throughput vs Prompt Eval

При оценке производительности LLM важно различать два режима работы:

  • Throughput (tokens/s generation): скорость генерации токенов после того, как модель «прочитала» промпт. Это критично для UX в чат-ботах.
  • Prompt Eval (tokens/s evaluation): скорость обработки входного контекста. Важна для работы с длинными документами.

Ниже представлены данные по средней скорости генерации 1024 токенов. Обратите внимание на разрыв между потребительскими решениями Apple и серверными решениями NVIDIA.

Скорость генерации (Throughput)

GPU 8B Q4_K_M 8B F16 70B Q4_K_M 70B F16
3070 8GB70.94OOMOOMOOM
3080 10GB106.40OOMOOMOOM
3080 Ti 12GB106.71OOMOOMOOM
4070 Ti 12GB82.21OOMOOMOOM
4080 16GB106.2240.29OOMOOM
RTX 4000 Ada 20GB58.5920.85OOMOOM
3090 24GB111.7446.51OOMOOM
4090 24GB127.7454.34OOMOOM
RTX 5000 Ada 32GB89.8732.67OOMOOM
3090 24GB * 2108.0747.1516.29OOM
4090 24GB * 2122.5653.2719.06OOM
RTX A6000 48GB102.2240.2514.58OOM
RTX 6000 Ada 48GB130.9951.9718.36OOM
A40 48GB88.9533.9512.08OOM
L40S 48GB113.6043.4215.31OOM
RTX 4000 Ada 20GB * 456.1420.587.33OOM
A100 PCIe 80GB138.3154.5622.11OOM
A100 SXM 80GB133.3853.1824.33OOM
H100 PCIe 80GB144.4967.7925.01OOM
3090 24GB * 4104.9446.4016.89OOM
4090 24GB * 4117.6152.6918.83OOM
RTX 5000 Ada 32GB * 482.7331.9411.45OOM
3090 24GB * 6101.0745.5516.935.82
4090 24GB * 8116.1352.1218.766.45
RTX A6000 48GB * 493.7338.8714.324.74
RTX 6000 Ada 48GB * 4118.9950.2517.966.06
A40 48GB * 483.7933.2811.913.98
L40S 48GB * 4105.7242.4814.995.03
A100 PCIe 80GB * 4117.3051.5422.687.38
A100 SXM 80GB * 497.7045.4519.606.92
H100 PCIe 80GB * 4118.1462.9026.209.63
M1 7‑Core GPU 8GB9.72OOMOOMOOM
M1 Max 32‑Core GPU 64GB34.4918.434.09OOM
M2 Ultra 76-Core GPU 192GB76.2836.2512.134.71
M3 Max 40‑Core GPU 64GB50.7422.397.53OOM
💡 Важно: Аббревиатура "OOM" означает Out Of Memory (нехватка памяти). Это критическое ограничение Apple Silicon для моделей размером 70B в точности F16, где требуется огромный объем VRAM, который даже M2 Ultra (192GB) с трудом справляется в некоторых конфигурациях, а M3 Max (64GB) — вообще не может загрузить.

02Анализ производительности

Результаты демонстрируют четкое разделение сфер применения. NVIDIA H100 и A100 остаются безоговорочными лидерами в задачах, требующих высокой пропускной способности памяти (HBM). Для модели 8B в формате F16 H100 выдает 67.79 токенов в секунду, что более чем в 3 раза быстрее лучшего результата Apple (M2 Ultra — 36.25 t/s).

Однако Apple Silicon демонстрирует удивительную эффективность в квантованных форматах (Q4_K_M). M2 Ultra с 192 ГБ унифицированной памяти генерирует 76.28 токенов/с для 8B модели. Это сопоставимо с производительностью одной видеокарты RTX 4090 (127.74 t/s) с учетом того, что M2 Ultra потребляет значительно меньше энергии и не требует сложного охлаждения, как серверная стойка.

Для моделей среднего размера (70B) преимущество NVIDIA становится еще очевиднее. M2 Ultra справляется с 70B Q

Источник: источник (тест/офиц. документация) ↗