Главная/Блог/Обзор/NVIDIA vs Apple Silicon: скорость…
Обзор6 мин чтения · 16 июля 2026 г.

NVIDIA vs Apple Silicon: скорость инференса LLM

тест токен/с разных NVIDIA GPU и Apple Silicon (M-серии) на моделях 7B-70B через llama.cpp

NVIDIA vs Apple Silicon: скорость инференса LLM

NVIDIA vs Apple Silicon: скорость инференса LLM

Выбор аппаратной платформы для локального запуска больших языковых моделей (LLM) — это всегда поиск баланса между производительностью, стоимостью владения и энергоэффективностью. В последние годы Apple Silicon (чипы M1, M2, M3) стал серьезным конкурентом традиционным видеокартам NVIDIA, предлагая унифицированную архитектуру памяти. Однако, насколько они эффективны в реальных задачах генерации текста?

Для объективного сравнения были проведены тесты на базе модели LLaMA 3 с использованием оптимизированного движка llama.cpp. В качестве эталона выступали различные GPU NVIDIA (от RTX 30-й до 40-й серии, а также профессиональные A100 и H100) и устройства Apple: 13-дюймовый MacBook Air (M1), MacBook Pro (M1 Max, M3 Max) и Mac Studio (M2 Ultra). Тестировалась скорость генерации 1024 токенов при различных квантованиях (Q4_K_M, F16).

01Ключевые результаты производительности

Результаты тестов наглядно демонстрируют разрыв в возможностях между потребительскими решениями и серверным оборудованием, а также показывают, где именно Apple Silicon занимает свою нишу.

Скорость генерации (Tokens/s)

Ниже приведены данные по средней скорости генерации токенов. Чем выше значение, тем быстрее модель отвечает.

terminaltext
| GPU                        | 8B Q4_K_M | 8B F16 | 70B Q4_K_M | 70B F16 |
|----------------------------|-----------|--------|------------|---------|
| 3070 8GB                   | 70.94     | OOM    | OOM        | OOM     |
| 3080 10GB                  | 106.40    | OOM    | OOM        | OOM     |
| 3080 Ti 12GB               | 106.71    | OOM    | OOM        | OOM     |
| 4070 Ti 12GB               | 82.21     | OOM    | OOM        | OOM     |
| 4080 16GB                  | 106.22    | 40.29  | OOM        | OOM     |
| RTX 4000 Ada 20GB          | 58.59     | 20.85  | OOM        | OOM     |
| 3090 24GB                  | 111.74    | 46.51  | OOM        | OOM     |
| 4090 24GB                  | 127.74    | 54.34  | OOM        | OOM     |
| RTX 5000 Ada 32GB          | 89.87     | 32.67  | OOM        | OOM     |
| 3090 24GB * 2              | 108.07    | 47.15  | 16.29      | OOM     |
| 4090 24GB * 2              | 122.56    | 53.27  | 19.06      | OOM     |
| RTX A6000 48GB             | 102.22    | 40.25  | 14.58      | OOM     |
| RTX 6000 Ada 48GB          | 130.99    | 51.97  | 18.36      | OOM     |
| A40 48GB                   | 88.95     | 33.95  | 12.08      | OOM     |
| L40S 48GB                  | 113.60    | 43.42  | 15.31      | OOM     |
| RTX 4000 Ada 20GB * 4      | 56.14     | 20.58  | 7.33       | OOM     |
| A100 PCIe 80GB             | 138.31    | 54.56  | 22.11      | OOM     |
| A100 SXM 80GB              | 133.38    | 53.18  | 24.33      | OOM     |
| H100 PCIe 80GB             | 144.49  | 67.79  | 25.01      | OOM     |
| 3090 24GB * 4              | 104.94    | 46.40  | 16.89      | OOM     |
| 4090 24GB * 4              | 117.61    | 52.69  | 18.83      | OOM     |
| RTX 5000 Ada 32GB * 4      | 82.73     | 31.94  | 11.45      | OOM     |
| 3090 24GB * 6              | 101.07    | 45.55  | 16.93      | 5.82    |
| 4090 24GB * 8              | 116.13    | 52.12  | 18.76      | 6.45    |
| RTX A6000 48GB * 4         | 93.73     | 38.87  | 14.32      | 4.74    |
| RTX 6000 Ada 48GB * 4      | 118.99    | 50.25  | 17.96      | 6.06    |
| A40 48GB * 4               | 83.79     | 33.28  | 11.91      | 3.98    |
| L40S 48GB * 4              | 105.72    | 42.48  | 14.99      | 5.03    |
| A100 PCIe 80GB * 4         | 117.30    | 51.54  | 22.68      | 7.38    |
| A100 SXM 80GB * 4          | 97.70     | 45.45  | 19.60      | 6.92    |
| H100 PCIe 80GB * 4         | 118.14    | 62.90  | 26.20      | 9.63    |
| M1 7‑Core GPU 8GB          | 9.72      | OOM    | OOM        | OOM     |
| M1 Max 32‑Core GPU 64GB    | 34.49     | 18.43  | 4.09       | OOM     |
| M2 Ultra 76-Core GPU 192GB | 76.28     | 36.25  | 12.13      | 4.71    |
| M3 Max 40‑Core GPU 64GB    | 50.74     | 22.39  | 7.53       | OOM     |

Скорость оценки промпта (Prompt Eval Speed)

Этот показатель важен для скорости "подготовки" ответа. Высокий показатель означает, что модель быстрее "читает" контекст.

terminaltext
| GPU                        | 8B Q4_K_M | 8B F16  | 70B Q4_K_M | 70B F16 |
|----------------------------|-----------|---------|------------|---------|
| ... (данные аналогичны вышеприведенным, см. полный отчет) ...
💡 Важно: Обратите внимание на запись "OOM" (Out Of Memory). Это означает, что модель не поместилась в видеопамять устройства. Для моделей 70B параметров требуется значительный объем VRAM, что делает многие карты начального и среднего уровня (8GB-16GB) непригодными для их запуска в полном объеме.

02Анализ архитектуры и памяти

Главное преимущество NVIDIA — это огромная пропускная способность памяти (Memory Bandwidth) и поддержка мульти-GPU конфигураций. Как видно из таблицы, использование 4-х или 8-х видеокарт NVIDIA позволяет масштабировать производительность, особенно для моделей 70B параметров. Например, связка из 4-х H100 обеспечивает скорость 26.20 токенов/с для 70B Q4_K_M, что недостижимо для большинства потребительских решений.

Apple Silicon, напротив, использует унифицированную память. Это позволяет загружать огромные модели (например, M2 Ultra с 192GB памяти легко тянет 70B и даже 120B модели), но ограничивает общую скорость из-за меньшей пропускной способности по сравнению с топовыми серверными GPU NVIDIA. Тем не менее, M2 Ultra показывает впечатляющие результаты для настольного решения, обгоняя многие профессиональные карты NVIDIA прошлого поколения.

03Кому подойдёт

  • Разработчикам и энтузиастам с ограниченным бюджетом: MacBook Air M1/M2 — отличный входной билет для работы с 7B-13B моделями. Вы получаете тишину, отсутствие шума и возможность работать автономно.
  • Профессионалам, работающим с большими моделями (70B+): Mac Studio с M2 Ultra или M3 Max — это единственное решение "всё в одном", которое позволяет запускать тяжелые модели локально без серверной стойки. Если вам не нужна максимальная скорость (как у H100), а нужна вместимость памяти, Apple выигрывает.
  • Для продакшена и высоконагруженных задач: Однозначно NVIDIA. Кластеры из A100/H100 или даже RTX 4090 обеспечивают максимальную пропускную способность. Если вам важна каждая миллисекунда задержки (latency) и высокая скорость обработки запросов, облачные GPU NVIDIA остаются безальтернативным стандартом.

В итоге, выбор зависит от задачи: Apple Silicon выигрывает в портативности и вместимости памяти на один чип, а NVIDIA — в чистой вычислительной мощности и масштабируемости.

Источник: источник (тест/офиц. документация) ↗