Главная/Блог/Обзор/NVIDIA vs Apple Silicon: Реальные тесты…
Обзор4 мин чтения · 22 июля 2026 г.

NVIDIA vs Apple Silicon: Реальные тесты LLM в llama.cpp

Сравниваем скорость инференса LLaMA 3 на NVIDIA (RTX 4090, H100) и Apple M-серии. Таблицы токен/с, VRAM и советы по выбору железа для РФ.

NVIDIA vs Apple Silicon: Реальные тесты LLM в llama.cpp

Выбор платформы для локального запуска больших языковых моделей (LLM) — это всегда компромисс между ценой, доступностью и производительностью. Мы проанализировали реальные бенчмарки из репозитория GPU-Benchmarks-on-LLM-Inference, где тестировалась модель LLaMA 3 (8B и 70B) через llama.cpp. Сравнение проведено между серверными GPU NVIDIA (от RTX 3070 до H100) и мобильными/рабочими чипами Apple Silicon (M1, M2, M3 Max/Ultra).

01Скорость генерации: Токены в секунду

Главный метрика для пользователя — скорость генерации текста (tokens/s). Ниже приведены данные для генерации 1024 токенов. Обратите внимание: для моделей 70B в формате FP16 большинство GPU выдают ошибку OOM (Out Of Memory), так как не хватает видеопамяти.

Железо 8B Q4_K_M (ток/с) 70B Q4_K_M (ток/с) VRAM (прибл.)
RTX 4090 24GB 127.74 OOM ~6-8 GB (для 8B)
RTX 4090 24GB * 2 122.56 19.06 ~40 GB (для 70B)
RTX 6000 Ada 48GB 130.99 18.36 ~40 GB (для 70B)
H100 PCIe 80GB 144.49 25.01 ~40 GB (для 70B)
H100 PCIe 80GB * 4 118.14 26.20 >100 GB (для 70B)
M2 Ultra 192GB 76.28 12.13 ~40-48 GB (для 70B)
M3 Max 64GB 50.74 7.53 ~40 GB (для 70B)

Как видно, одна RTX 4090 генерирует текст в 2-3 раза быстрее, чем M2 Ultra (76.28 vs 127.74 ток/с для 8B). Однако Apple Silicon выигрывает в объеме памяти: M2 Ultra имеет 192 ГБ унифицированной памяти, что позволяет запускать огромные модели (например, 70B в квантованном виде) без необходимости кластеризации нескольких GPU, как это часто требуется для NVIDIA.

02Оценка промпта (Prompt Eval)

Скорость обработки входного контекста (prompt evaluation) критична для приложений с длинными документами. Здесь разрыв между NVIDIA и Apple еще заметнее.

Железо 8B Q4_K_M (ток/с) 70B Q4_K_M (ток/с)
RTX 4090 24GB 6898.71 OOM
H100 PCIe 80GB 7760.16 984.06
M2 Ultra 192GB 1023.89 117.76
M3 Max 64GB 678.04 62.88

RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B модели H100 показывает 984 ток/с, тогда как M2 Ultra — лишь 117 ток/с. NVIDIA безоговорочно лидирует в скорости вычислений.

03Как собрать и запустить

Для получения этих результатов используется llama.cpp. Команды сборки различаются в зависимости от платформы.

Для NVIDIA GPU (с поддержкой CUDA):

terminalbash
!make clean && LLAMA_CUBLAS=1 make -j

Для Apple Silicon (Metal):

terminalbash
!make clean && make -j

Для загрузки всех слоев модели на GPU используется флаг -ngl 10000. Если вы хотите использовать только CPU, укажите -ngl 0.

⚠️
Важно. На Apple Silicon (особенно M1 Max с 32 ГБ памяти) доступно только ~70% унифицированной памяти для GPU. На более новых чипах (M2/M3) этот показатель составляет около 78%. Если модель не помещается в доступную память, производительность резко падает из-за использования системной памяти.

04VRAM и совместимость моделей

Объем видеопамяти (VRAM) — это «бутылочное горлышко» для запуска больших моделей. Вот примерное распределение:

  • 8B модели (Q4_K_M): требуют ~6-8 ГБ VRAM. Подходят RTX 3070, 4070 Ti, M1/M2 базовые версии.
  • 70B модели (Q4_K_M): требуют ~40-48 ГБ VRAM. Здесь нужны RTX 4090 (в связке 2 шт.), RTX 6000 Ada, A100/H100 или M2 Ultra/M3 Max с большим объемом памяти.
  • Модели 70B (FP16): требуют >140 ГБ VRAM. Доступны только на конфигурациях из 4x H100 или 4x A100. Обычные потребительские видеокарты здесь бессильны.
💡
Совет. Если вы хотите запустить 70B модель на одном GPU, ищите карты с 48 ГБ памяти (RTX 6000 Ada, A6000, L40S) или используйте M2 Ultra (192 ГБ). Для 8B моделей достаточно 12-16 ГБ VRAM (RTX 4080/4090).

05Какое железо кому подойдёт

Выбор зависит от вашего бюджета и задач в условиях российского рынка:

  1. Бюджетный сегмент (До 100-150 тыс. руб.): RTX 4090 (24GB) или RTX 3090 (24GB). Это лучший выбор для локального инференса 8B-13B моделей. RTX 4090 быстрее, но 3090 можно найти б/у дешевле. M1/M2 MacBook Air/Pro с 8-16 ГБ памяти подойдут только для очень легких моделей (до 7B в сильном квантовании) и будут работать медленно.
  2. Профессиональный сегмент (300-500 тыс. руб.): RTX 4080 (16GB) или RTX 4000 Ada (20GB). Позволяют запускать 8B модели в FP16. Для 70B моделей этого объема мало, но можно рассмотреть связку из двух карт. Apple MacBook Pro M3 Max (64GB/96GB) — отличная альтернатива, если важна мобильность и энергоэффективность, но скорость будет ниже NVIDIA в 2-3 раза.
  3. High-End / Серверный сегмент (от 1 млн руб.): RTX 6000 Ada (48GB) или аренда A100/H100 на облачных платформах (RunPod, Vast.ai и др., доступных через посредников в РФ). Для запуска 70B моделей в реальном времени с высокой скоростью нужна RTX 6000 Ada или связка из двух RTX 4090. M2 Ultra (Mac Studio) — уникальный вариант, позволяющий запустить 70B модель на одном устройстве с приемлемой скоростью (12 ток/с), что недоступно на большинстве потребительских GPU NVIDIA из-за нехватки VRAM.

Итог: Для максимальной скорости генерации берите NVIDIA RTX 4090/4000 Ada. Для запуска самых больших моделей (70B+) на одном устройстве без сложной настройки кластера — Apple M2/M3 Ultra. В России сейчас проще всего арендовать NVIDIA GPU через облака, так как прямые поставки серверного оборудования ограничены.

Источник: источник (тест/офиц. документация) ↗