Главная/Блог/Обзор/NVIDIA vs Apple Silicon: Тест LLM на…
Обзор5 мин чтения · 1 октября 2026 г.

NVIDIA vs Apple Silicon: Тест LLM на токены/с

Сравнение скорости инференса LLaMA 3 на NVIDIA (RTX 4090, H100) и Apple M-серии. Реальные цифры токен/с, VRAM и выбор железа для РФ.

NVIDIA vs Apple Silicon: Тест LLM на токены/с

Выбор платформы для локального запуска больших языковых моделей (LLM) — это всегда компромисс между скоростью генерации, объемом памяти и доступностью. Мы проанализировали данные бенчмарков llama.cpp для модели LLaMA 3, сравнив потребительские видеокарты NVIDIA, профессиональные решения (A100/H100) и Apple Silicon. Разница в производительности между сегментами может быть десятикратной, но не всегда оправдывает переплату.

01Скорость генерации: Токены в секунду

Главный показатель для пользователя — скорость генерации текста (tokens/s). Чем выше число, тем быстрее вы получаете ответ. В тестах использовалась квантованная модель 8B (Q4_K_M) и 70B (Q4_K_M). Для моделей 70B в формате FP16 большинство карт выдают Out Of Memory (OOM), поэтому фокус на Q4.

Железо VRAM LLaMA 3 8B (Q4_K_M) LLaMA 3 70B (Q4_K_M)
RTX 4090 24 GB 127.74 OOM
RTX 4090 * 2 48 GB 122.56 19.06
RTX 4090 * 4 96 GB 117.61 18.83
RTX 4090 * 8 192 GB 116.13 18.76
H100 PCIe 80 GB 144.49 25.01
H100 PCIe * 4 320 GB 118.14 26.20
M2 Ultra 192 GB 76.28 12.13
M3 Max 64 GB 50.74 7.53

Как видно, одиночная RTX 4090 генерирует текст в 2-3 раза быстрее, чем M2 Ultra с огромным объемом памяти. Однако, 4090 не тянет 70B-модели в одиночку. Для 70B-моделей единственными viable вариантами из списка стали H100, мульти-GPU конфигурации NVIDIA и M2 Ultra. M3 Max (64GB) также не справляется с 70B Q4_K_M в данном тесте (вероятно, из-за ограничений памяти или оптимизации, так как 64GB должно хватить, но тест показывает OOM или низкую скорость, в таблице указано OOM для 70B F16, но для Q4_K_M скорость 7.53 т/с, что очень медленно). Correction based on table: M3 Max 64GB показывает 7.53 токена/с для 70B Q4_K_M, то есть она запускается, но очень медленно. M2 Ultra (192GB) показывает 12.13 т/с. H100 показывает 25.01 т/с. H100 * 4 показывает 26.20 т/с. Увеличение количества H100 не дает линейного прироста скорости генерации для одной модели, так как модель не размещается полностью на одной карте эффективно или ограничена шиной.

02Скорость оценки промпта: Prompt Eval Speed

Это метрика того, как быстро карта «прочитает» ваш длинный запрос (1024 токена). Здесь NVIDIA демонстрирует абсолютное доминирование благодаря высокой пропускной способности памяти и CUDA-ядрам.

Железо LLaMA 3 8B (Q4_K_M) LLaMA 3 70B (Q4_K_M)
RTX 4090 6898.71 OOM
RTX 4090 * 8 9706.82 1336.26
H100 PCIe * 4 11560.23 1133.23
M2 Ultra 1023.89 117.76

Четыре H100 обрабатывают промпт для 8B модели почти в 11 раз быстрее, чем M2 Ultra. Для 70B модели RTX 4090 * 8 (8 видеокарт) показывает 1336.26 токенов/с на оценку, что сопоставимо с одной H100 (984.06) и лучше, чем H100 * 4 (1133.23) в некоторых метриках, но H100 * 4 выигрывает в скорости генерации (26.20 против 18.76). Это показывает, что для инференса важна не только память, но и вычислительная мощность.

03Сборка и запуск

Для получения этих результатов используется llama.cpp. Компиляция под NVIDIA требует включения CUDA, под Apple Silicon — Metal (включен по умолчанию).

Для NVIDIA GPU

terminalbash
!make clean && LLAMA_CUBLAS=1 make -j

Для Apple Silicon

terminalbash
!make clean && make -j

При запуске критически важно правильно указать параметры загрузки. Флаг -ngl 10000 гарантирует, что все слои модели будут загружены в VRAM/Unified Memory. Если оставить -ngl 0, инференс пойдет на CPU, что резко снизит скорость.

⚠️
Важно. Для Apple Silicon есть нюанс с объемом памяти. На M1 Max с 32GB RAM только ~70% памяти доступно для GPU, чтобы сохранить производительность. На более новых чипах (M2/M3 Ultra) этот лимит составляет около 78%. Если вы видите падение скорости, проверьте recommendedMaxWorkingSetSize в логах. Для использования всей памяти можно попробовать -ngl 0 (только CPU), но это убьет скорость.

04Что реально купить/арендовать в РФ

В условиях санкций прямая покупка H100/A100 в РФ затруднена, но их можно арендовать через облачные провайдеры (RunPod, Vast.ai, локальные облака). RTX 4090 доступна в магазинах, но с наценкой. Apple M-серия доступна через параллельный импорт.

  • Бюджетный вариант (до 150-200 тыс. руб.): RTX 4090 (24GB). Идеальна для 7B-13B моделей. Тянет 70B в квантовании Q4 только в связке с другими картами или через CPU offload (медленно). M2 MacBook Pro (32GB/96GB) — хороший портативный вариант для 7B-13B, но медленнее 4090.
  • Средний сегмент (300-500 тыс. руб.): Две RTX 4090 (48GB суммарно). Позволяют запускать 70B модели с приемлемой скоростью (19 т/с). M2 Ultra (192GB) — король памяти, но медленнее в вычислениях. Подходит для работы с длинными контекстами и большими моделями, если скорость не критична.
  • Премиум/Серверный уровень: Аренда H100/A100. Если нужна максимальная скорость для 70B+ моделей, лучше арендовать кластер H100, чем покупать железо. Одна H100 дает 25 т/с для 70B, что в 2 раза быстрее M2 Ultra.
💡
Совет. Если вы выбираете между M2 Ultra и двумя RTX 4090, помните: M2 Ultra выигрывает по объему памяти (192GB против 48GB), что позволяет запускать модели покрупнее (например, 70B с большим контекстом) без разбиения. Но RTX 4090 * 2 даст в 2-3 раза больше скорости генерации. Для инференса скорость часто важнее объема, если модель помещается.

05Какое железо кому подойдёт

  • Энтузиасты и разработчики (Бюджет: 150-250 тыс. руб.): Берите RTX 4090. Это лучший баланс цены и скорости для моделей до 13B. Для 70B придется использовать квантование Q2/Q3 или ждать, пока VRAM не станет больше. M3 Max (64GB) — отличная альтернатива, если нужна портативность и тишина, но скорость будет в 2 раза ниже.
  • Бизнес и прод (Бюджет: 500 тыс. - 1 млн+ руб.): Конфигурация из 2-4 RTX 4090. Позволяет запускать 70B модели локально. Альтернатива — аренда H100 на почасовой основе, если нагрузка непостоянна. M2 Ultra (192GB) имеет смысл только если вам критически важен объем памяти для очень длинных контекстов (до 100k+ токенов) и вы готовы мириться с низкой скоростью (12 т/с для 70B).
  • Корпоративный уровень: Аренда кластеров H100/A100. Для высоких нагрузок и low-latency инференса 70B+ моделей NVIDIA остается безальтернативным лидером. M-серия пока не может конкурировать по скорости генерации на больших моделях.

Итог: Для большинства задач инференса LLM в РФ сегодня оптимальна связка RTX 4090. Apple Silicon — это ниша для работы с памятью и портативности, а не для скорости. H100 — это стандарт для промышленного уровня, но доступен преимущественно через аренду.

Источник: источник (тест/офиц. документация) ↗