Главная/Блог/Обзор/NVIDIA vs Apple Silicon: Тест LLM на…
Обзор5 мин чтения · 2 июля 2026 г.

NVIDIA vs Apple Silicon: Тест LLM на токены/с

Сравнение скорости инференса LLaMA 3 на NVIDIA (RTX 4090, H100) и Apple M-серии. Реальные цифры токен/с, VRAM и выбор железа для РФ.

NVIDIA vs Apple Silicon: Тест LLM на токены/с

Выбор платформы для локального запуска больших языковых моделей (LLM) — это всегда компромисс между ценой, доступностью и производительностью. Мы проанализировали данные бенчмарков llama.cpp для модели LLaMA 3, сравнив потребительские видеокарты NVIDIA, профессиональные решения (A100/H100) и Apple Silicon. Главный вопрос: где вы получите больше токенов в секунду за каждый потраченный рубль?

01Скорость генерации (Tokens/Second)

Скорость генерации — это то, что чувствует пользователь в реальном времени. Чем выше число, тем быстрее модель «думает». В тестах использовалась квантованная версия Q4_K_M и полная точность F16. Обратите внимание: многие карты с малым объемом VRAM просто не могут загрузить большие модели (OOM — Out Of Memory).

Железо VRAM LLaMA 3 8B (Q4_K_M) LLaMA 3 70B (Q4_K_M)
RTX 4090 (1x) 24 GB 127.74 OOM
RTX 4090 (2x) 48 GB 122.56 19.06
RTX 4090 (4x) 96 GB 117.61 18.83
RTX 4090 (8x) 192 GB 116.13 18.76
H100 PCIe (1x) 80 GB 144.49 25.01
H100 PCIe (4x) 320 GB 118.14 26.20
M2 Ultra 192 GB 76.28 12.13
M3 Max 64 GB 50.74 7.53

Как видно, одна RTX 4090 выигрывает у M2 Ultra в скорости генерации 8B-моделей (127 vs 76 токенов/с). Однако для 70B-моделей 4090 требует как минимум двух карт, и скорость падает до ~19 токенов/с. H100 показывает лучший результат для 70B (25-26 токенов/с), но стоит в разы дороже. Apple M2 Ultra с 192 ГБ памяти позволяет запустить 70B-модель, но скорость генерации составляет всего 12.13 токенов/с, что приемлемо для чтения, но медленно для интерактивного диалога.

⚠️
Важно. Для запуска LLaMA 3 70B в квантовании Q4 требуется минимум ~40-48 ГБ VRAM. Одна RTX 4090 (24 ГБ) не справится. Вам нужно либо 2x RTX 4090, либо 1x RTX A6000/A4000 Ada, либо Apple Mac с 64+ ГБ унифицированной памяти.

02Скорость оценки промпта (Prompt Eval)

Это метрика того, как быстро модель «читает» ваш запрос. Высокие значения здесь важны для приложений с длинными контекстами. Здесь NVIDIA демонстрирует абсолютное доминирование.

Железо LLaMA 3 8B (Q4_K_M) LLaMA 3 70B (Q4_K_M)
RTX 4090 (1x) 6898.71 OOM
RTX 4090 (8x) 9706.82 1336.26
H100 PCIe (4x) 11560.23 1133.23
M2 Ultra 1023.89 117.76

Одна RTX 4090 обрабатывает промпт для 8B-модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B-моделей разрыв еще более впечатляющ: 8x RTX 4090 дают 1336 токенов/с против 117 у M2 Ultra. Apple Silicon уступает NVIDIA в пропускной способности памяти (bandwidth), что критично для этой фазы инференса.

03Сборка и запуск

Для получения этих результатов используется llama.cpp. Компиляция под разные платформы имеет свои нюансы.

Для NVIDIA GPU необходимо включить поддержку CUDA:

terminalbash
!make clean && LLAMA_CUBLAS=1 make -j

Для Apple Silicon Metal включен по умолчанию, сборка проще:

terminalbash
!make clean && make -j

При запуске важно правильно указать параметры. Флаг -ngl 10000 гарантирует, что все слои модели будут загружены в GPU/VRAM. Если памяти не хватает, модель начнет использовать CPU, что резко снизит скорость.

💡
Совет. На Apple Silicon (M1 Max 32GB) доступно только ~70% унифицированной памяти для GPU. На более новых чипах этот показатель около 78%. Если вы видите падение производительности, проверьте лимиты памяти через recommendedMaxWorkingSetSize.

04Реальность рынка РФ: что купить или арендовать?

В условиях импортозамещения и санкций прямая покупка топовых NVIDIA (H100, A100) для частных лиц в РФ практически невозможна. RTX 4090 можно купить, но их цена завышена. Аренда облачных GPU (RunPod, Vast.ai, локальные провайдеры) остается основным способом доступа к мощностям.

  • Бюджетный сегмент (RTX 3090/4090): Лучшее соотношение цена/производительность для энтузиастов. 2x RTX 3090 (24GB) — это «народный» вариант для запуска 70B-моделей. В РФ их можно найти на вторичном рынке или собрать сервер.
  • Профессиональный сегмент (A100/H100): Доступны только через аренду. H100 показывает рекордные скорости, но стоимость часа аренды высока. Подходит для продакшена и тяжелых нагрузок.
  • Apple Silicon: Идеально для портативности и энергоэффективности. M2/M3 Max с 64-192 ГБ памяти позволяют запускать огромные модели локально без интернета. Но скорость генерации (12-26 токенов/с для 70B) ниже, чем у NVIDIA.

05Какое железо кому подойдёт

1. Энтузиаст / Разработчик (Бюджет: 150-300 тыс. руб.)
Выбор: 2x RTX 4090 или 2x RTX 3090 (б/у).
Почему: Это позволит вам запускать LLaMA 3 70B (Q4) с приемлемой скоростью (~19 токенов/с). Для 8B-моделей скорость будет отличной (>120 токенов/с). Это самый быстрый способ получить мощный инференс своими руками в РФ.

2. Бизнес / Продакшен (Бюджет: Аренда GPU)
Выбор: A100 80GB или H100 через облака.
Почему: Если вам нужна стабильность, высокая скорость обработки промптов (Prompt Eval) и возможность масштабирования, аренда H100/A100 выгоднее покупки железа. H100 выдает до 26 токенов/с на 70B-модели, что в 1.5 раза быстрее, чем на 8x RTX 4090.

3. Путешественник / Офис (Бюджет: 200-400 тыс. руб. за Mac)
Выбор: Mac Studio/Pro с M2/M3 Max и 64-192 ГБ памяти.
Почему: Если вам не критична скорость генерации (12-20 токенов/с), но важна автономность, тишина и возможность запускать модели без интернета. M2 Ultra с 192 ГБ памяти — единственный потребительский вариант, который легко тянет 70B-модели в полном объеме без сложной настройки мульти-GPU.

Итог: Для скорости — NVIDIA (RTX 4090/A100/H100). Для портативности и простоты запуска больших моделей — Apple M-серия. Для 8B-моделей одна RTX 4090 разбивает любого конкурента по скорости.

Источник: Официальная документация ↗