Главная/Блог/Обзор/NVIDIA vs Apple Silicon: кто быстрее…
Обзор5 мин чтения · 11 сентября 2026 г.

NVIDIA vs Apple Silicon: кто быстрее генерирует LLM?

Сравниваем скорость инференса LLaMA 3 на NVIDIA (RTX 4090, H100) и Apple M-серии. Реальные цифры токенов/с, VRAM и выбор железа для РФ.

Выбор платформы для локального запуска больших языковых моделей (LLM) — это всегда компромисс между ценой, доступностью и производительностью. Мы проанализировали данные бенчмарков llama.cpp для модели LLaMA 3, чтобы понять, где лучше запускать 8B и 70B модели: на видеокартах NVIDIA или на чипах Apple Silicon. Важно отметить, что тесты проводились с использованием сборки llama.cpp с флагом LLAMA_CUBLAS=1 для NVIDIA и нативным Metal для Apple.

01Скорость генерации (Inference Speed)

Главный метрика для пользователя — скорость генерации токенов (tokens/s). Чем выше число, тем быстрее вы получаете ответ. В таблице ниже приведены средние скорости генерации 1024 токенов для различных конфигураций.

Железо 8B Q4_K_M (ток/с) 70B Q4_K_M (ток/с) VRAM (ГБ)
H100 PCIe 80GB 144.49 25.01 80
RTX 6000 Ada 48GB 130.99 18.36 48
RTX 4090 24GB 127.74 OOM 24
M2 Ultra 192GB 76.28 12.13 192
M3 Max 64GB 50.74 7.53 64
RTX 3090 24GB 111.74 OOM 24

Как видно, NVIDIA H100 является абсолютным лидером по скорости генерации для 8B моделей (144.49 ток/с). Однако для 70B моделей даже H100 выдает лишь 25 ток/с, тогда как связка из 8x RTX 4090 (в тесте не указана как единый узел, но логически 4x4090 дают 18.83 ток/с) или специализированные решения могут быть эффективнее в масштабе. RTX 4090 показывает отличные результаты для 8B моделей (127.74 ток/с), но не может запустить 70B модель в квантовании Q4 из-за нехватки VRAM (Out Of Memory).

Apple M2 Ultra с 192 ГБ унифицированной памяти демонстрирует впечатляющую 12.13 ток/с для 70B модели. Это делает его единственным потребительским/профессиональным решением Apple, способным комфортно запускать 70B модели в Q4. M3 Max (64GB) справляется медленнее (7.53 ток/с), но тоже работает.

⚠️
Важно. Для NVIDIA GPU необходимо использовать флаг сборки LLAMA_CUBLAS=1. Без него ускорение через CUDA ядра не будет задействовано, и скорость будет значительно ниже. Для Apple Silicon Metal включен по умолчанию.

02Скорость оценки промпта (Prompt Eval)

Вторая важная метрика — скорость обработки входного промпта (tokens/s). Это критично для приложений с длинным контекстом. Здесь разрыв между NVIDIA и Apple становится еще более очевидным.

Железо 8B Q4_K_M (ток/с) 70B Q4_K_M (ток/с)
H100 PCIe 80GB 7760.16 984.06
RTX 4090 24GB 6898.71 OOM
M2 Ultra 192GB 1023.89 117.76
M3 Max 64GB 678.04 62.88

RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B моделей RTX 4090 снова упирается в VRAM. M2 Ultra обрабатывает 70B промпт со скоростью 117.76 ток/с, что приемлемо, но значительно медленнее, чем решения NVIDIA.

💡
Совет. Если вам важна скорость отклика при длинных промптах (RAG, анализ документов), NVIDIA RTX 4090/4080 предпочтительнее. Если же вы работаете с 70B моделями и вам не хватает VRAM на NVIDIA, M2 Ultra — один из немногих вариантов «всё в одном».

03VRAM и совместимость

Объем видеопамяти — критический ограничитель. В тестах многие конфигурации помечены как OOM (Out Of Memory), что означает нехватку памяти для загрузки модели.

  • 8B модели (Q4): Требуют ~6-8 ГБ VRAM. Легко запускаются на RTX 3070, 3080, 4070 Ti, M1, M3 Max.
  • 70B модели (Q4): Требуют ~40-48 ГБ VRAM. Здесь лидируют RTX A6000 (48GB), RTX 6000 Ada (48GB), A100 (80GB), H100 (80GB) и M2 Ultra (192GB). Обычные игровые карты (RTX 3090/4090 по 24GB) не справляются с 70B в одиночку.
  • 70B модели (F16): Требуют ~140 ГБ VRAM. Запускаются только на конфигурациях с 6x24GB (3090), 8x24GB (4090), 4x48GB (A6000/6000 Ada), 4x80GB (A100/H100) и M2 Ultra (192GB).

Для Apple Silicon есть нюанс: только 70% унифицированной памяти доступно для GPU на M1 Max (32GB), и около 78% на более новых чипах. Это нужно учитывать при планировании загрузки моделей.

⚠️
Важно. На Apple Silicon для использования всей памяти в CPU-режиме можно использовать флаг -ngl 0, но это резко снизит скорость. Для GPU-ускорения объем памяти ограничен системными ограничениями Metal.

04Реальность для РФ: что купить или арендовать?

В условиях санкций прямая покупка NVIDIA H100/A100 в РФ затруднена, а цены на б/у или «серые» поставки завышены. Однако инференс LLM можно эффективно организовать иначе:

  1. Аренда GPU (Cloud): Платформы вроде RunPod (упоминается в источнике) или российские аналоги (Vast.ai аналоги, Selectel, Yandex Cloud) позволяют арендовать H100/A100 по часам. Для тяжелых 70B+ моделей это часто выгоднее покупки железа.
  2. RTX 4090/3090: Легко доступны в РФ. Для 8B моделей это лучший выбор по цене/производительности. Для 70B моделей потребуется связка из 2-4 карт, что дорого и требует мощного блока питания и материнской платы с достаточным числом PCIe линий.
  3. Apple Mac Studio/Pro: M2 Ultra доступен через импортеров. Это единственное решение «всё в одном» для запуска 70B моделей без сложной настройки мульти-GPU. M3 Max (64GB) — хороший компромисс для 8B и легких 70B (в Q4).

05Какое железо кому подойдёт

  • Бюджетный энтузиаст (до 100 тыс. руб.): RTX 3090/4090 (б/у или новая). Отлично для 8B моделей (Llama-3-8B, Mistral-7B). Скорость генерации 100-120 ток/с. 70B модели не запустятся.
  • Продвинутый пользователь (150-300 тыс. руб.): Две RTX 4090 или RTX 3090. Позволяет запускать 70B модели в Q4 (скорость ~16-19 ток/с). Требует тщательной настройки PCIe и питания.
  • Профессионал/Бизнес (высокий бюджет): Аренда H100/A100 в облаке для тяжелых задач. Или покупка Mac Studio M2 Ultra (если доступен) для автономной работы с 70B моделями (12 ток/с). Для 8B моделей M2 Ultra медленнее NVIDIA, но выигрывает в энергоэффективности и тишине.
  • Максимальная скорость (неограниченный бюджет): Связка 4x H100 или 4x RTX 6000 Ada. Для 70B моделей это дает до 26 ток/с (H100) и до 1133 ток/с для оценки промпта.

Итог: для 8B моделей NVIDIA RTX 4090 безоговорочно быстрее. Для 70B моделей выбор стоит между сложной мульти-GPU сборкой на NVIDIA (RTX 4090/3090) и удобным, но более медленным Apple M2 Ultra. H100 остается эталоном, но доступен только через облака.

Источник: источник (тест/офиц. документация) ↗