Главная/Блог/Обзор/NVIDIA vs Apple Silicon: реальные…
Обзор5 мин чтения · 23 июля 2026 г.

NVIDIA vs Apple Silicon: реальные скорости LLM в llama.cpp

Сравниваем RTX 4090, H100 и M2 Ultra по скорости инференса LLaMA 3. Разбираем, где хватает VRAM, а где система падает с OOM.

NVIDIA vs Apple Silicon: реальные скорости LLM в llama.cpp

Выбор железа для локального запуска больших языковых моделей (LLM) часто сводится к спору: «купить мощную видеокарту NVIDIA» или «взять MacBook с Apple Silicon». Чтобы не гадать, мы опираемся на реальные бенчмарки из репозитория GPU-Benchmarks-on-LLM-Inference, где тестировалась генерация 1024 токенов в модели LLaMA 3. Данные собраны с использованием llama.cpp на различных конфигурациях: от одиночных RTX 3070 до кластеров из 8xRTX 4090 и серверных H100.

01Скорость генерации: токены в секунду

Главный показатель для пользователя — скорость генерации текста (tokens/s). Чем выше число, тем быстрее вы получаете ответ. Тестировались квантованные модели Q4_K_M (баланс качества и скорости) и полноразрядные F16.

Железо 8B Q4_K_M (ток/с) 70B Q4_K_M (ток/с) VRAM (ГБ)
RTX 4090 (1x) 127.74 OOM (не хватает памяти) 24
RTX 4090 (2x) 122.56 19.06 48 (сумм.)
RTX 4090 (4x) 117.61 18.83 96 (сумм.)
RTX 4090 (8x) 116.13 18.76 192 (сумм.)
RTX 6000 Ada (1x) 130.99 18.36 48
A100 PCIe 80GB (1x) 138.31 22.11 80
H100 PCIe 80GB (1x) 144.49 25.01 80
M2 Ultra (192GB) 76.28 12.13 192
M3 Max (64GB) 50.74 7.53 64

Как видно, одиночная RTX 4090 выигрывает у M2 Ultra в скорости генерации моделей 8B (127.74 против 76.28 ток/с). Однако для моделей 70B в квантовании Q4 требуется около 40-48 ГБ VRAM. Одиночная 4090 здесь «падает» с ошибкой Out Of Memory (OOM). Чтобы запустить 70B на NVIDIA, нужно минимум две видеокарты (2x24GB), что снижает пиковую скорость до ~19 ток/с. Единичная RTX 6000 Ada (48GB) или A100 (80GB) справляются с 70B быстрее, чем связка из двух 4090.

Apple Silicon M2 Ultra с 192 ГБ памяти позволяет запустить 70B модель без проблем, но скорость генерации (12.13 ток/с) значительно уступает серверным решениям NVIDIA. M3 Max с 64 ГБ памяти также тянет 70B, но медленнее (7.53 ток/с).

⚠️
Важно. Для NVIDIA GPU обязательно нужна сборка с поддержкой CUDA. Используйте флаг LLAMA_CUBLAS=1. Без него вы получите работу только на CPU, что в десятки раз медленнее.

02Скорость оценки промпта (Prompt Eval)

Вторая важная метрика — скорость обработки входного текста (prompt evaluation). Это критично, если вы работаете с длинными контекстами. Здесь NVIDIA демонстрирует абсолютное доминирование.

Железо 8B Q4_K_M (ток/с) 70B Q4_K_M (ток/с)
RTX 4090 (1x) 6898.71 OOM
RTX 4090 (4x) 9609.29 898.17
H100 (1x) 7760.16 984.06
H100 (4x) 11560.23 1133.23
M2 Ultra 1023.89 117.76

Одиночная RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B модели одиночная 4090 не подходит из-за нехватки памяти, но даже кластер из 4x4090 уступает единичному H100 в скорости обработки промпта (898 против 984 ток/с).

03Как собрать и запустить

Все тесты проводились через llama.cpp. Команды сборки и запуска стандартны, но требуют внимания к деталям.

Для NVIDIA GPU:

terminalbash
!make clean && LLAMA_CUBLAS=1 make -j

Для Apple Silicon (Metal включен по умолчанию):

terminalbash
!make clean && make -j

Для принудительной загрузки всех слоев на GPU используйте флаг -ngl 10000. Если вы хотите использовать только CPU, укажите -ngl 0.

💡
Совет. На Apple Silicon (M1 Max 32GB) доступно только ~70% памяти для GPU, чтобы сохранить стабильность системы. На больших чипах (M2 Ultra, M3 Max) этот лимит составляет около 78%. Если вам нужно использовать всю память, переключитесь на CPU-инференс (-ngl 0), но скорость упадет.

04VRAM: сколько нужно для моделей?

Из таблицы видно, что модели 8B в квантовании Q4 помещаются даже в 8 ГБ VRAM (RTX 3070), но скорость там скромная — 70.94 ток/с. Для моделей 70B требуется минимум 40-48 ГБ памяти. Это объясняет, почему одиночные потребительские карты (24 ГБ) не справляются, а профессиональные 48 ГБ (RTX 6000 Ada, A6000) или серверные 80 ГБ (A100, H100) работают стабильно.

Модели 70B в полном формате F16 не помещаются ни в одну из протестированных конфигураций (кроме, возможно, очень медленного CPU-режима или специфических оптимизаций, не охваченных в базовом тесте), так как требуют ~140 ГБ памяти.

⚠️
Важно. Ошибка OOM (Out Of Memory) означает, что модель не загрузилась. Для 70B Q4_K_M вам нужно суммарно не менее 48 ГБ видеопамяти. Это либо одна RTX 6000 Ada/A6000, либо две RTX 4090/3090, либо Apple M2 Ultra (192 ГБ).

05Какое железо кому подойдёт

Выбор зависит от бюджета и задач, доступных на российском рынке (учитывая ограничения на поставки топовых NVIDIA в РФ, актуальны б/у рынки, аренда через RunPod/Vast.ai или использование Apple Silicon).

  • Бюджетный энтузиаст (до 100-150 тыс. руб.): Две б/у RTX 3090 (24 ГБ каждая). Итого 48 ГБ VRAM. Вы сможете запускать 70B модели со скоростью ~16-19 ток/с. Это лучший вариант по соотношению цена/VRAM для локального запуска больших моделей.
  • Максимальная скорость (бюджет не ограничен): Аренда H100 или A100 через облака. H100 дает 144 ток/с для 8B и 25 ток/с для 70B. Локально купить H100 практически невозможно и нецелесообразно из-за цены и энергопотребления.
  • Мобильность и баланс (MacBook Pro): M2 Ultra (192 ГБ) — идеальный вариант для работы с 70B моделями «в поле». Скорость 12 ток/с достаточна для интерактивного общения, а 192 ГБ памяти позволяют держать огромные контексты. M3 Max (64 ГБ) — компромисс: 70B запустится, но медленнее (7.5 ток/с). Для 8B моделей M3 Max/M2 Pro будут очень быстрыми.
  • Продакшн-серверы: Кластеры из 4xRTX 4090 или 4xA100. 4x4090 дают ~117 ток/с для 8B и ~18-19 ток/с для 70B. Это дешевле, чем H100, но требует сложной настройки NVLink/CUDA-коммуникации.

Итог: NVIDIA выигрывает в скорости, особенно при наличии достаточного VRAM. Apple Silicon выигрывает в доступности большого объема единой памяти и энергоэффективности, но проигрывает в пропускной способности памяти (bandwidth), что ограничивает скорость генерации.

Источник: источник (тест/офиц. документация) ↗