NVIDIA vs Apple Silicon: скорость инференса LLM
Выбор аппаратной платформы для локального запуска больших языковых моделей (LLM) — это всегда поиск баланса между производительностью, стоимостью владения и энергоэффективностью. В последние годы Apple Silicon (чипы M1, M2, M3) стал серьезным конкурентом традиционным видеокартам NVIDIA, предлагая унифицированную архитектуру памяти. Однако, насколько они эффективны в реальных задачах генерации текста?
Для объективного сравнения были проведены тесты на базе модели LLaMA 3 с использованием оптимизированного движка llama.cpp. В качестве эталона выступали различные GPU NVIDIA (от RTX 30-й до 40-й серии, а также профессиональные A100 и H100) и устройства Apple: 13-дюймовый MacBook Air (M1), MacBook Pro (M1 Max, M3 Max) и Mac Studio (M2 Ultra). Тестировалась скорость генерации 1024 токенов при различных квантованиях (Q4_K_M, F16).
01Ключевые результаты производительности
Результаты тестов наглядно демонстрируют разрыв в возможностях между потребительскими решениями и серверным оборудованием, а также показывают, где именно Apple Silicon занимает свою нишу.
Скорость генерации (Tokens/s)
Ниже приведены данные по средней скорости генерации токенов. Чем выше значение, тем быстрее модель отвечает.
| GPU | 8B Q4_K_M | 8B F16 | 70B Q4_K_M | 70B F16 |
|----------------------------|-----------|--------|------------|---------|
| 3070 8GB | 70.94 | OOM | OOM | OOM |
| 3080 10GB | 106.40 | OOM | OOM | OOM |
| 3080 Ti 12GB | 106.71 | OOM | OOM | OOM |
| 4070 Ti 12GB | 82.21 | OOM | OOM | OOM |
| 4080 16GB | 106.22 | 40.29 | OOM | OOM |
| RTX 4000 Ada 20GB | 58.59 | 20.85 | OOM | OOM |
| 3090 24GB | 111.74 | 46.51 | OOM | OOM |
| 4090 24GB | 127.74 | 54.34 | OOM | OOM |
| RTX 5000 Ada 32GB | 89.87 | 32.67 | OOM | OOM |
| 3090 24GB * 2 | 108.07 | 47.15 | 16.29 | OOM |
| 4090 24GB * 2 | 122.56 | 53.27 | 19.06 | OOM |
| RTX A6000 48GB | 102.22 | 40.25 | 14.58 | OOM |
| RTX 6000 Ada 48GB | 130.99 | 51.97 | 18.36 | OOM |
| A40 48GB | 88.95 | 33.95 | 12.08 | OOM |
| L40S 48GB | 113.60 | 43.42 | 15.31 | OOM |
| RTX 4000 Ada 20GB * 4 | 56.14 | 20.58 | 7.33 | OOM |
| A100 PCIe 80GB | 138.31 | 54.56 | 22.11 | OOM |
| A100 SXM 80GB | 133.38 | 53.18 | 24.33 | OOM |
| H100 PCIe 80GB | 144.49 | 67.79 | 25.01 | OOM |
| 3090 24GB * 4 | 104.94 | 46.40 | 16.89 | OOM |
| 4090 24GB * 4 | 117.61 | 52.69 | 18.83 | OOM |
| RTX 5000 Ada 32GB * 4 | 82.73 | 31.94 | 11.45 | OOM |
| 3090 24GB * 6 | 101.07 | 45.55 | 16.93 | 5.82 |
| 4090 24GB * 8 | 116.13 | 52.12 | 18.76 | 6.45 |
| RTX A6000 48GB * 4 | 93.73 | 38.87 | 14.32 | 4.74 |
| RTX 6000 Ada 48GB * 4 | 118.99 | 50.25 | 17.96 | 6.06 |
| A40 48GB * 4 | 83.79 | 33.28 | 11.91 | 3.98 |
| L40S 48GB * 4 | 105.72 | 42.48 | 14.99 | 5.03 |
| A100 PCIe 80GB * 4 | 117.30 | 51.54 | 22.68 | 7.38 |
| A100 SXM 80GB * 4 | 97.70 | 45.45 | 19.60 | 6.92 |
| H100 PCIe 80GB * 4 | 118.14 | 62.90 | 26.20 | 9.63 |
| M1 7‑Core GPU 8GB | 9.72 | OOM | OOM | OOM |
| M1 Max 32‑Core GPU 64GB | 34.49 | 18.43 | 4.09 | OOM |
| M2 Ultra 76-Core GPU 192GB | 76.28 | 36.25 | 12.13 | 4.71 |
| M3 Max 40‑Core GPU 64GB | 50.74 | 22.39 | 7.53 | OOM |Скорость оценки промпта (Prompt Eval Speed)
Этот показатель важен для скорости "подготовки" ответа. Высокий показатель означает, что модель быстрее "читает" контекст.
| GPU | 8B Q4_K_M | 8B F16 | 70B Q4_K_M | 70B F16 |
|----------------------------|-----------|---------|------------|---------|
| ... (данные аналогичны вышеприведенным, см. полный отчет) ...02Анализ архитектуры и памяти
Главное преимущество NVIDIA — это огромная пропускная способность памяти (Memory Bandwidth) и поддержка мульти-GPU конфигураций. Как видно из таблицы, использование 4-х или 8-х видеокарт NVIDIA позволяет масштабировать производительность, особенно для моделей 70B параметров. Например, связка из 4-х H100 обеспечивает скорость 26.20 токенов/с для 70B Q4_K_M, что недостижимо для большинства потребительских решений.
Apple Silicon, напротив, использует унифицированную память. Это позволяет загружать огромные модели (например, M2 Ultra с 192GB памяти легко тянет 70B и даже 120B модели), но ограничивает общую скорость из-за меньшей пропускной способности по сравнению с топовыми серверными GPU NVIDIA. Тем не менее, M2 Ultra показывает впечатляющие результаты для настольного решения, обгоняя многие профессиональные карты NVIDIA прошлого поколения.
03Кому подойдёт
- Разработчикам и энтузиастам с ограниченным бюджетом: MacBook Air M1/M2 — отличный входной билет для работы с 7B-13B моделями. Вы получаете тишину, отсутствие шума и возможность работать автономно.
- Профессионалам, работающим с большими моделями (70B+): Mac Studio с M2 Ultra или M3 Max — это единственное решение "всё в одном", которое позволяет запускать тяжелые модели локально без серверной стойки. Если вам не нужна максимальная скорость (как у H100), а нужна вместимость памяти, Apple выигрывает.
- Для продакшена и высоконагруженных задач: Однозначно NVIDIA. Кластеры из A100/H100 или даже RTX 4090 обеспечивают максимальную пропускную способность. Если вам важна каждая миллисекунда задержки (latency) и высокая скорость обработки запросов, облачные GPU NVIDIA остаются безальтернативным стандартом.
В итоге, выбор зависит от задачи: Apple Silicon выигрывает в портативности и вместимости памяти на один чип, а NVIDIA — в чистой вычислительной мощности и масштабируемости.
Источник: источник (тест/офиц. документация) ↗
