Главная/Блог/Обзор/NVIDIA vs Apple Silicon: Тест LLM на…
Обзор4 мин чтения · 21 августа 2026 г.

NVIDIA vs Apple Silicon: Тест LLM на llama.cpp

Сравнение скорости инференса LLaMA 3 на NVIDIA (RTX 4090, H100) и Apple Silicon (M2 Ultra). Реальные цифры токенов/с и VRAM.

NVIDIA vs Apple Silicon: Тест LLM на llama.cpp

Выбор железа для локального запуска больших языковых моделей (LLM) часто сводится к дилемме: мощные, но дорогие серверные GPU NVIDIA или доступные Apple Mac с унифицированной памятью. Мы проанализировали реальные бенчмарки из репозитория GPU-Benchmarks-on-LLM-Inference, где тестировалась модель LLaMA 3 через llama.cpp. Результаты показывают, что для разных задач есть свои «чемпионы».

01Скорость генерации (Tokens/Second)

Первый и самый важный метрик для пользователя — скорость генерации текста. Ниже приведены данные для генерации 1024 токенов. Обратите внимание: для моделей 70B в F16 большинство GPU выдают OOM (Out Of Memory), так как не хватает видеопамяти.

Железо LLaMA 3 8B (Q4_K_M) LLaMA 3 8B (F16) LLaMA 3 70B (Q4_K_M) VRAM (мин.)
H100 PCIe 80GB 144.49 67.79 25.01 80 GB
A100 PCIe 80GB 138.31 54.56 22.11 80 GB
RTX 4090 24GB 127.74 54.34 OOM 24 GB
RTX 6000 Ada 48GB 130.99 51.97 18.36 48 GB
M2 Ultra 192GB 76.28 36.25 12.13 192 GB
M3 Max 64GB 50.74 22.39 7.53 64 GB

Как видно, H100 лидирует по чистой скорости генерации для 8B-моделей (144 токена/с). Однако RTX 4090 демонстрирует феноменальную производительность для своего класса, почти догоняя серверные решения в квантованных режимах. Apple M2 Ultra, обладая огромным объемом памяти, показывает respectable результаты (76 токенов/с), что делает его отличным компромиссом для работы с большими моделями, которые не влезают в 24 ГБ VRAM.

⚠️
Важно. Для моделей 70B в точности F16 (без квантования) большинство GPU, включая RTX 4090 и M3 Max, выдают ошибку OOM. Для 70B моделей требуется минимум 48-80 ГБ VRAM или унифицированной памяти. В тестах 70B F16 успешно запустились только конфигурации с 6+ GPU (например, 6x 3090) или специфические настройки.

02Скорость оценки промпта (Prompt Eval)

Второй метрик — скорость обработки входного контекста (prompt evaluation). Это критично, если вы работаете с длинными документами. Здесь разрыв между NVIDIA и Apple становится еще более очевидным.

Железо LLaMA 3 8B (Q4_K_M) LLaMA 3 70B (Q4_K_M)
H100 PCIe 80GB 7760.16 984.06
4090 24GB 6898.71 OOM
M2 Ultra 192GB 1023.89 117.76
M3 Max 64GB 678.04 62.88

RTX 4090 и H100 обрабатывают промпты в 6-7 раз быстрее, чем M2 Ultra. Если ваша задача — анализ огромных баз знаний (RAG), NVIDIA выигрывает безоговорочно. Apple Silicon проигрывает из-за меньшей пропускной способности памяти по сравнению с CUDA-ядрами в этом сценарии.

03Сборка и запуск

Для получения этих результатов используется llama.cpp. Команды сборки и запуска отличаются в зависимости от платформы. Важно правильно указать флаги отгрузки слоев на GPU.

Для NVIDIA GPU:

terminalbash
!make clean && LLAMA_CUBLAS=1 make -j

Для Apple Silicon:

terminalbash
!make clean && make -j

Запуск генерации текста с полной отгрузкой на GPU:

terminalbash
!./main -ngl 10000 -m ./models/8B-v3/ggml-model-Q4_K_M.gguf --color --temp 1.1 --repeat_penalty 1.1 -c 0 -n 1024 -e -s 0 -p """\
💡
Совет. На Apple Silicon (M1/M2/M3 Max/Ultra) используйте флаг -ngl 10000 для отгрузки всех слоев. Однако обратите внимание: только ~70-78% унифицированной памяти доступно для GPU. Если модель не влезает, система начнет использовать CPU, что резко снизит скорость. Для M1 Max 32GB это ограничение критично.

04Какое железо кому подойдёт

Исходя из данных и реалий рынка РФ:

  • Бюджетный энтузиаст (до 100-150 тыс. руб.): RTX 4090 (24GB). Лучшее соотношение цена/производительность для 7B-13B моделей. Для 70B Q4_K_M не хватит памяти, но можно попробовать 2x 3090/4090 (если есть место и блок питания).
  • Профессионал / Small Business (аренда): RunPod или аналоги. Аренда H100/A100 дает максимальную скорость. Для 70B моделей Q4_K_M H100 выдает 25 токенов/с, что комфортно для работы. RTX 4090 в облаке стоит дешевле, но для 70B Q4_K_M она не подходит (OOM).
  • Работа с большими моделями (70B+) на своем железе: Apple Mac Studio с M2 Ultra (192GB RAM). Это единственный способ запустить 70B Q4_K_M локально без облака. Скорость (12 токенов/с) ниже, чем у H100, но модель работает полностью локально и конфиденциально. RTX A6000 (48GB) или 2x RTX 3090 (48GB) — альтернатива, но сложнее в настройке и дороже в покупке б/у.
  • Максимальная скорость (Enterprise): H100 PCIe 80GB. Лидер по всем показателям. Доступна только через аренду в облаке, так как стоимость и энергопотребление делают покупку для частных лиц нецелесообразной.

Итог: Если вам нужна скорость обработки промптов и генерации для моделей до 13B — берите NVIDIA RTX 4090. Если нужно запускать 70B+ локально и важна конфиденциальность, а не скорость — выбирайте Mac Studio M2 Ultra. Для тяжелых нагрузок в продакшене — только облачные H100/A100.

Источник: источник (тест/офиц. документация) ↗