Главная/Блог/Обзор/NVIDIA vs Apple Silicon: Реальные тесты…
Обзор5 мин чтения · 10 сентября 2026 г.

NVIDIA vs Apple Silicon: Реальные тесты LLM в llama.cpp

Сравниваем скорость инференса LLaMA 3 на RTX 4090, H100 и Apple M3 Max. Разбираем VRAM, токен/с и подводные камни сборки.

Выбор железа для локального запуска больших языковых моделей (LLM) — это всегда компромисс между скоростью генерации, объемом видеопамяти и доступностью. В свежих бенчмарках от сообщества XiongjieDai протестированы различные конфигурации NVIDIA и Apple Silicon на модели LLaMA 3 с использованием оптимизированного движка llama.cpp. Результаты показывают, что «король горы» не всегда выигрывает в каждой категории, а Apple Silicon демонстрирует удивительную эффективность для своих классов.

01Скорость генерации: Токены в секунду

Главный метрика для пользователя — скорость генерации текста (tokens/s). Тестировалась генерация 1024 токенов. Ниже приведены ключевые результаты для квантованных моделей Q4_K_M (наиболее популярный баланс качества и скорости) и полноразрядных F16.

Железо VRAM LLaMA 3 8B (Q4_K_M) LLaMA 3 70B (Q4_K_M)
H100 PCIe 80GB 80 GB 144.49 25.01
RTX 4090 24GB 24 GB 127.74 OOM
RTX 6000 Ada 48GB 48 GB 130.99 18.36
M2 Ultra 192GB 192 GB 76.28 12.13
M3 Max 64GB 64 GB 50.74 7.53
A100 SXM 80GB 80 GB 133.38 24.33

Как видно, RTX 4090 (и её серверный аналог RTX 6000 Ada) невероятно быстры в генерации для моделей 8B, почти догоняя H100. Однако для моделей 70B 24GB VRAM недостаточно, и карта выдает ошибку Out Of Memory (OOM). Здесь вступают в игру карты с большим объемом памяти: RTX 6000 Ada (48GB) и A100/H100 (80GB) справляются с 70B-моделями, но скорость генерации падает в 2-3 раза по сравнению с 8B-версией.

Apple M2 Ultra с 192 ГБ унифицированной памяти позволяет запустить 70B-модель со скоростью 12.13 токена/с. Это медленно по сравнению с NVIDIA, но невероятно быстро для ноутбука/стации, не требующей охлаждения серверного уровня.

02Оценка контекста (Prompt Eval)

Скорость обработки входного промпта (prompt eval speed) критична для приложений с длинным контекстом. Здесь разрыв между NVIDIA и Apple становится еще более очевидным.

Железо LLaMA 3 8B (Q4_K_M) LLaMA 3 70B (Q4_K_M)
H100 PCIe 80GB 7760.16 984.06
RTX 4090 24GB 6898.71 OOM
M2 Ultra 192GB 1023.89 117.76
M3 Max 64GB 678.04 62.88

RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M3 Max. Для 70B модели M2 Ultra показывает 117 токенов/с, что приемлемо для чтения длинных документов, но H100 делает это в 8 раз быстрее (984 токена/с).

03Сборка и настройка llama.cpp

Для получения этих результатов необходимо правильно собрать llama.cpp. Ключевое отличие — использование CUDA для NVIDIA и Metal для Apple Silicon.

Для NVIDIA GPU:

terminalbash
!make clean && LLAMA_CUBLAS=1 make -j

Для Apple Silicon:

terminalbash
!make clean && make -j

При запуске важно правильно указать параметры. Флаг -ngl 10000 гарантирует, что все слои модели будут загружены в GPU/VRAM. Если памяти не хватает, модель начнет использовать системную RAM, что резко снизит скорость.

⚠️
Важно. На Apple Silicon (M1 Max 32GB) доступно только ~70% унифицированной памяти для GPU, чтобы сохранить производительность. На более новых чипах (M2/M3 Ultra) этот лимит составляет около 78%. Если вы видите падение FPS, проверьте recommendedMaxWorkingSetSize в логах.

04VRAM и совместимость моделей

Объем памяти — это не просто цифра, это фильтр доступных моделей. Исходные данные четко показывают границы применимости:

  • 8GB VRAM (RTX 3070, M1 8GB): Только модели 7B-8B в квантовании Q4. F16 и 70B — OOM.
  • 16-20GB VRAM (RTX 4080, RTX 4000 Ada): 8B в F16 возможна (40-50 токенов/с), но 70B — OOM.
  • 24GB VRAM (RTX 3090/4090): Идеально для 8B (Q4/F16). 70B — OOM без свопинга в CPU.
  • 48GB VRAM (RTX 6000 Ada, A40, L40S): Комфортный запуск 70B Q4 (~18-24 токена/с). 8B работает на максимуме.
  • 80GB+ VRAM (A100, H100): Единственный способ запустить 70B F16 или 8B с огромным контекстом. H100 также позволяет запускать 70B F16 со скоростью 25 токенов/с.
💡
Совет. Если вы хотите запустить LLaMA 3 70B на потребительском железе, вам нужно либо собрать кластер из 2x RTX 3090/4090 (48GB суммарно), либо искать серверные карты типа RTX A6000 (48GB) или A100 (40/80GB). Один RTX 4090 24GB физически не вместит 70B модель в Q4 без серьезного замедления на CPU.

05Какое железо кому подойдёт

Выбор зависит от бюджета и задач. Вот честная разбивка:

1. Бюджетный энтузиаст (До 100-150 тыс. руб.)

Железо: 2x RTX 3090 (б/у) или 1x RTX 4090.

Что запустит: LLaMA 3 8B (очень быстро), LLaMA 3 70B (медленно, с использованием CPU-свопа или 2-карточным режимом). Для 8B модели RTX 4090 дает 127 токенов/с — это уровень продакшена.

2. Профессиональный разработчик / Small Business (500 тыс. - 1 млн руб.)

Железо: Mac Studio M2 Ultra (192GB RAM) или б/у RTX A6000 48GB.

Что запустит: M2 Ultra позволяет запустить 70B модель со скоростью 12 токенов/с. Это медленно для чат-бота, но отлично для анализа документов. RTX A6000 быстрее (14-18 токенов/с для 70B), но требует мощного блока питания и корпуса.

3. Enterprise / High-Performance (Аренда или покупка серверов)

Железо: A100 80GB или H100 80GB (через RunPod/Vast.ai или локально).

Что запустит: H100 — абсолютный лидер. 144 токена/с для 8B и 25 токенов/с для 70B. Если вам нужна скорость обработки промптов (prompt eval), H100 превосходит всё остальное в 5-10 раз. Для РФ сейчас актуальна аренда облачных GPU, так как прямые поставки H100/A100 ограничены, но на рынке есть предложения через посредников.

Итог: Для 8B моделей RTX 4090 — лучший выбор по цене/производительности. Для 70B моделей без облака нужен либо Mac M2 Ultra (для удобства и памяти), либо серверные NVIDIA с 48GB+ VRAM.

Источник: источник (тест/офиц. документация) ↗