Главная/Блог/Обзор/NVIDIA vs Apple Silicon: Тест LLM на…
Обзор4 мин чтения · 20 августа 2026 г.

NVIDIA vs Apple Silicon: Тест LLM на токены/с

Сравнение скорости инференса LLaMA 3 на NVIDIA (RTX 4090, H100) и Apple Silicon (M2 Ultra). Реальные цифры токен/с, VRAM и команды сборки llama.cpp.

NVIDIA vs Apple Silicon: Тест LLM на токены/с

Выбор железа для локального запуска больших языковых моделей (LLM) часто сводится к спору: «купить мощную видеокарту NVIDIA или собрать Mac Studio с унифицированной памятью»? Тесты на модели LLaMA 3 через движок llama.cpp дают четкие ответы. Ниже — разбор реальных данных по скорости генерации (tokens/s) и оценке контекста, а также практические советы для российских пользователей.

01Скорость генерации: NVIDIA против Apple

Главный метрика для инференса — скорость генерации токенов. В тестах использовалась модель LLaMA 3 с квантованием Q4_K_M (наиболее популярный баланс качества и скорости). Данные собраны для генерации 1024 токенов.

Однокарточные решения NVIDIA доминируют в сегменте 8B-моделей. RTX 4090 (24GB) выдает 127.74 токена/с, что почти в 2.5 раза быстрее, чем флагман Apple M2 Ultra (76-Core GPU, 192GB) со скоростью 76.28 токена/с. Однако Apple Silicon выигрывает за счет объема памяти: M2 Ultra позволяет запускать модели 70B, которые физически не влезают в одну RTX 4090.

Для моделей 70B (Q4_K_M) ситуация меняется:

  • H100 PCIe 80GB: 25.01 ток/с (лидер по скорости).
  • RTX 6000 Ada 48GB: 18.36 ток/с.
  • M2 Ultra 192GB: 12.13 ток/с.
  • M3 Max 64GB: 7.53 ток/с (OOM для F16).

Обратите внимание: многие карты NVIDIA (3070, 3080, 4070 Ti) выдают OOM (Out Of Memory) на моделях 70B, так как им не хватает VRAM даже для квантованных версий. M2 Ultra с 192GB памяти позволяет запустить 70B F16 (4.71 ток/с), что недоступно для большинства потребительских GPU NVIDIA.

02Скорость оценки контекста (Prompt Eval)

Этот показатель важен для скорости «подогрева» контекста (processing input). Здесь разрыв между NVIDIA и Apple еще более заметен. RTX 4090 обрабатывает 8B Q4_K_M со скоростью 6898.71 ток/с, в то время как M2 Ultra — всего 1023.89 ток/с. H100 в кластере из 4 штук достигает феноменальных 11560.23 ток/с.

Железо Модель Генерация (ток/с) VRAM / Примечание
RTX 4090 24GB LLaMA 3 8B Q4_K_M 127.74 Влезает полностью
M2 Ultra 192GB LLaMA 3 70B Q4_K_M 12.13 Влезает полностью
H100 PCIe 80GB LLaMA 3 70B Q4_K_M 25.01 Влезает полностью
RTX 4090 24GB * 8 LLaMA 3 70B F16 6.45 Мультитеенанси

03Сборка и запуск llama.cpp

Для получения этих результатов необходимо правильно собрать llama.cpp. Флаги сборки критичны для производительности.

Для NVIDIA GPU требуется поддержка CUDA:

terminalbash
!make clean && LLAMA_CUBLAS=1 make -j

Для Apple Silicon Metal включен по умолчанию, но сборка выглядит проще:

terminalbash
!make clean && make -j

При запуске важно правильно указать параметры. Флаг -ngl 10000 гарантирует, что все слои модели будут загружены в память GPU/Unified Memory. Если использовать -ngl 0, инференс пойдет только на CPU, что резко снизит скорость.

⚠️
Важно. На Apple Silicon (особенно M1 Max 32GB) доступно только ~70% унифицированной памяти для GPU. На более новых чипах (M2/M3 Ultra) этот показатель приближается к 78%. Если модель не влезает в доступную память, скорость упадет из-за свопинга в основную память.

04Что реально купить/арендовать в РФ

В условиях санкций прямые поставки NVIDIA в РФ затруднены, но рынок насыщен:

  1. RTX 4090 (24GB): Самый популярный вариант для энтузиастов. Цена на вторичном рынке или у серых импортеров высока, но это лучший выбор для 8B-моделей. Для 70B-моделей одной карты мало.
  2. RTX 3090 (24GB): Бюджетная альтернатива. Часто продается б/у. Позволяет запускать 70B Q4_K_M, но со скоростью ~111 ток/с (8B) и ~16 ток/с (70B). Отличный входной билет в мир больших моделей.
  3. Mac Studio M2 Ultra: Доступен в РФ, но по завышенным ценам. Выигрывает только если вам нужен объем памяти 192GB для запуска 70B-моделей без квантования или с минимальной потерей качества. Скорость инференса значительно ниже, чем у NVIDIA.
  4. Аренда (RunPod/Vast.ai): Для тяжелых задач (70B+ или кластеры) выгоднее арендовать H100/A100. H100 PCIe 80GB дает 25 ток/с на 70B Q4, что в 2 раза быстрее M2 Ultra. Для 8B моделей H100 выдает 144 ток/с.
💡
Совет. Если вы запускаете LLaMA 3 8B, берите RTX 4090 или RTX 3090. Разница в скорости генерации между ними невелика, но 3090 дешевле. Если нужна 70B модель — либо собирайте кластер из 2x/4x RTX 3090/4090, либо берите Mac Studio M2 Ultra, если бюджет позволяет, а скорость не критична.

05Какое железо кому подойдёт

  • Бюджетный энтузиаст (до 100-150 тыс. руб.): RTX 3090 (б/у). 24GB VRAM позволяют запускать 70B Q4_K_M. Скорость приемлемая, но для мульти-GPU нужно две карты.
  • Продвинутый пользователь (150-250 тыс. руб.): RTX 4090. Лучшая скорость для 8B-моделей (127+ ток/с). Для 70B-моделей одной карты недостаточно, нужен мульти-GPU или квантование до Q2/Q3 (с потерей качества).
  • Корпоративный сегмент / Серверы: A100/H100 через аренду. H100 PCIe 80GB — король скорости (25 ток/с на 70B Q4). В РФ купить новые сложно, но аренда на RunPod или локальных облаках решает задачу.
  • Максималисты по памяти: Mac Studio M2 Ultra (192GB). Единственный вариант «из коробки» для запуска 70B F16 (полная точность) на одном устройстве, albeit с низкой скоростью (4.71 ток/с). Подходит для разработки и тестирования, где важна точность, а не скорость ответа.

Итог: NVIDIA выигрывает в скорости и экосистеме (CUDA). Apple Silicon выигрывает в объеме памяти на чип и энергоэффективности, но проигрывает в вычислительной мощности для инференса LLM.

Источник: источник (тест/офиц. документация) ↗