Главная/Блог/Обзор/NVIDIA vs Apple Silicon: честный тест…
Обзор4 мин чтения · 7 августа 2026 г.

NVIDIA vs Apple Silicon: честный тест скорости LLM

Сравниваем RTX 4090, H100 и M2 Ultra в инференсе LLaMA 3. Реальные цифры токенов/с, VRAM и выбор железа для РФ.

NVIDIA vs Apple Silicon: честный тест скорости LLM

Выбор платформы для локального запуска больших языковых моделей (LLM) часто сводится к спору: «купить мощную видеокарту NVIDIA» или «взять MacBook с Apple Silicon». Тесты на базе llama.cpp и модели LLaMA 3 дают четкое понимание, где какая архитектура выигрывает. Ниже — разбор реальных данных по скорости генерации (tokens/s) и оценке контекста (prompt eval) для конфигураций от бюджетных до серверных.

01Скорость генерации токенов (tokens/s)

Это ключевой показатель для интерактивного общения с чат-ботом. Чем выше число, тем быстрее модель отвечает. Тестировалась генерация 1024 токенов.

Железо 8B Q4_K_M 70B Q4_K_M VRAM (прибл.)
RTX 4090 24GB 127.74 OOM (не влезает) ~16 GB (для 8B)
RTX 4090 24GB * 2 122.56 19.06 ~48 GB (общая)
RTX 4090 24GB * 4 117.61 18.83 ~96 GB (общая)
H100 PCIe 80GB 144.49 25.01 ~42 GB (для 70B)
H100 PCIe 80GB * 4 118.14 26.20 ~168 GB (общая)
M2 Ultra 192GB 76.28 12.13 ~42 GB (для 70B)

Как видно, H100 лидирует по одиночной карте для 8B моделей (144.44 токена/с), но при масштабировании на 4 карты скорость генерации падает до уровня RTX 4090. Это связано с накладными расходами на межкарточное взаимодействие. Для 70B моделей H100 * 4 выдает 26.20 токена/с, что быстрее M2 Ultra (12.13 токена/с) почти в 2 раза, но требует огромного бюджета.

⚠️
Важно. Для моделей 70B в квантовании Q4_K_M требуется около 40-42 ГБ VRAM. Одиночная RTX 4090 (24 ГБ) или M3 Max (64 ГБ, но с ограничениями) не справляются с F16, но Q4_K_M позволяет уместить 70B в 24-48 ГБ, хотя скорость падает. M1 Max (32 ГБ) вообще не тянет 70B Q4_K_M в полной мере без выгрузки на CPU, что убивает скорость.

02Скорость оценки промпта (Prompt Eval)

Этот показатель важен для обработки длинных контекстов (RAG, анализ документов). Здесь NVIDIA демонстрирует подавляющее преимущество благодаря высокой пропускной памяти и оптимизации CUDA.

Железо 8B Q4_K_M 70B Q4_K_M
RTX 4090 24GB 6898.71 OOM
RTX 4090 24GB * 4 9609.29 898.17
H100 PCIe 80GB * 4 11560.23 1133.23
M2 Ultra 192GB 1023.89 117.76

Четыре H100 обрабатывают промпт для 8B модели со скоростью 11 560 токенов/с. M2 Ultra, несмотря на 192 ГБ единой памяти, выдает лишь 1023.89 токенов/с. Разница в 10 раз. Для Apple Silicon это «узкое горлышко» пропускной способности памяти при чтении весов модели.

03Сборка и запуск

Для получения этих результатов используется llama.cpp. Компиляция под NVIDIA требует включения CUDA, под Apple — Metal (по умолчанию).

Для NVIDIA GPU

terminalbash
!make clean && LLAMA_CUBLAS=1 make -j

Для Apple Silicon

terminalbash
!make clean && make -j

При запуске критически важен флаг -ngl 10000 (или достаточно большое число), чтобы загрузить все слои модели в GPU/Unified Memory. Если использовать -ngl 0, инференс пойдет на CPU, что для M-серии будет в разы медленнее.

💡
Совет. На Apple Silicon (особенно M1 Max 32GB) доступно только ~70% памяти для GPU, чтобы сохранить стабильность системы. На более новых чипах (M2/M3 Ultra) этот лимит около 78%. Если модель не влезает в доступную GPU-память, llama.cpp начнет сбрасывать данные в RAM, что резко снизит скорость. Всегда проверяйте recommendedMaxWorkingSetSize в логах.

04Какое железо кому подойдёт

1. Бюджетный энтузиаст (до 150-200 тыс. руб.)

Вариант: 2x RTX 3090/4090 (б/у или новые) или 1x RTX 4090 + M2 Pro MacBook.

Одна RTX 4090 (24 ГБ) — король для 7B-13B моделей. Она выдает >127 токенов/с. Для 70B моделей одна карта не справится. Нужна связка из двух карт (NVLink не обязателен для llama.cpp, но помогает в некоторых кейсах, хотя в тестах 2x4090 показали 19.06 ток/с против 25 у H100). В РФ купить 2x3090 б/у — самый дешевый способ запустить 70B Q4. M1/M2 MacBook Air/Pro с 16-32 ГБ памяти подходят только для 7B-13B моделей и обучения/тонкой настройки, но не для быстрого инференса 70B.

2. Профессионал / Small Business (500 тыс. - 1.5 млн руб.)

Вариант: 4x RTX 4090 или аренда A100/H100 в облаке (RunPod и др.).

Связка 4x RTX 4090 дает ~117 токенов/с на 8B и ~18-19 токенов/с на 70B. Это отличный баланс цены и производительности. В РФ 4 видеокарты — это сложная задача по охлаждению и питанию, но реализуемо. Альтернатива — аренда H100 в облаке за $2-3/час, если нужна пиковая скорость эпизодически. Для постоянной работы 4x4090 выгоднее.

3. Enterprise / High-End (от 2 млн руб. и выше)

Вариант: H100 (аренда или покупка через серых посредников) или Mac Studio M2 Ultra.

M2 Ultra (192 ГБ) — уникальный вариант. Он позволяет запустить 70B-130B модели в F16 (полная точность) или Q8, что недоступно для 24-48 ГБ видеокарт. Скорость (12-14 токенов/с для 70B) достаточна для многих бизнес-задач, где важна не мгновенная реакция, а качество ответа и контекст. Однако для обработки длинных документов (Prompt Eval) M2 Ultra уступает NVIDIA в 10 раз. Если вам нужна скорость — берите NVIDIA. Если нужна емкость памяти для больших моделей без квантования — M2 Ultra.

Итог: Для скорости — NVIDIA (RTX 4090/H100). Для емкости и энергоэффективности на больших моделях — Apple M2 Ultra. Для 7B-13B моделей любая современная RTX 40-й серии или M-серия справится отлично.

Источник: источник (тест/офиц. документация) ↗