Выбор платформы для локального запуска больших языковых моделей (LLM) часто сводится к спору: «купить мощную видеокарту NVIDIA» или «взять MacBook с Apple Silicon». Тесты на базе llama.cpp и модели LLaMA 3 дают четкое понимание, где какая архитектура выигрывает. Ниже — разбор реальных данных по скорости генерации (tokens/s) и оценке контекста (prompt eval) для конфигураций от бюджетных до серверных.
01Скорость генерации токенов (tokens/s)
Это ключевой показатель для интерактивного общения с чат-ботом. Чем выше число, тем быстрее модель отвечает. Тестировалась генерация 1024 токенов.
| Железо | 8B Q4_K_M | 70B Q4_K_M | VRAM (прибл.) |
|---|---|---|---|
| RTX 4090 24GB | 127.74 | OOM (не влезает) | ~16 GB (для 8B) |
| RTX 4090 24GB * 2 | 122.56 | 19.06 | ~48 GB (общая) |
| RTX 4090 24GB * 4 | 117.61 | 18.83 | ~96 GB (общая) |
| H100 PCIe 80GB | 144.49 | 25.01 | ~42 GB (для 70B) |
| H100 PCIe 80GB * 4 | 118.14 | 26.20 | ~168 GB (общая) |
| M2 Ultra 192GB | 76.28 | 12.13 | ~42 GB (для 70B) |
Как видно, H100 лидирует по одиночной карте для 8B моделей (144.44 токена/с), но при масштабировании на 4 карты скорость генерации падает до уровня RTX 4090. Это связано с накладными расходами на межкарточное взаимодействие. Для 70B моделей H100 * 4 выдает 26.20 токена/с, что быстрее M2 Ultra (12.13 токена/с) почти в 2 раза, но требует огромного бюджета.
02Скорость оценки промпта (Prompt Eval)
Этот показатель важен для обработки длинных контекстов (RAG, анализ документов). Здесь NVIDIA демонстрирует подавляющее преимущество благодаря высокой пропускной памяти и оптимизации CUDA.
| Железо | 8B Q4_K_M | 70B Q4_K_M |
|---|---|---|
| RTX 4090 24GB | 6898.71 | OOM |
| RTX 4090 24GB * 4 | 9609.29 | 898.17 |
| H100 PCIe 80GB * 4 | 11560.23 | 1133.23 |
| M2 Ultra 192GB | 1023.89 | 117.76 |
Четыре H100 обрабатывают промпт для 8B модели со скоростью 11 560 токенов/с. M2 Ultra, несмотря на 192 ГБ единой памяти, выдает лишь 1023.89 токенов/с. Разница в 10 раз. Для Apple Silicon это «узкое горлышко» пропускной способности памяти при чтении весов модели.
03Сборка и запуск
Для получения этих результатов используется llama.cpp. Компиляция под NVIDIA требует включения CUDA, под Apple — Metal (по умолчанию).
Для NVIDIA GPU
!make clean && LLAMA_CUBLAS=1 make -jДля Apple Silicon
!make clean && make -jПри запуске критически важен флаг -ngl 10000 (или достаточно большое число), чтобы загрузить все слои модели в GPU/Unified Memory. Если использовать -ngl 0, инференс пойдет на CPU, что для M-серии будет в разы медленнее.
recommendedMaxWorkingSetSize в логах.04Какое железо кому подойдёт
1. Бюджетный энтузиаст (до 150-200 тыс. руб.)
Вариант: 2x RTX 3090/4090 (б/у или новые) или 1x RTX 4090 + M2 Pro MacBook.
Одна RTX 4090 (24 ГБ) — король для 7B-13B моделей. Она выдает >127 токенов/с. Для 70B моделей одна карта не справится. Нужна связка из двух карт (NVLink не обязателен для llama.cpp, но помогает в некоторых кейсах, хотя в тестах 2x4090 показали 19.06 ток/с против 25 у H100). В РФ купить 2x3090 б/у — самый дешевый способ запустить 70B Q4. M1/M2 MacBook Air/Pro с 16-32 ГБ памяти подходят только для 7B-13B моделей и обучения/тонкой настройки, но не для быстрого инференса 70B.
2. Профессионал / Small Business (500 тыс. - 1.5 млн руб.)
Вариант: 4x RTX 4090 или аренда A100/H100 в облаке (RunPod и др.).
Связка 4x RTX 4090 дает ~117 токенов/с на 8B и ~18-19 токенов/с на 70B. Это отличный баланс цены и производительности. В РФ 4 видеокарты — это сложная задача по охлаждению и питанию, но реализуемо. Альтернатива — аренда H100 в облаке за $2-3/час, если нужна пиковая скорость эпизодически. Для постоянной работы 4x4090 выгоднее.
3. Enterprise / High-End (от 2 млн руб. и выше)
Вариант: H100 (аренда или покупка через серых посредников) или Mac Studio M2 Ultra.
M2 Ultra (192 ГБ) — уникальный вариант. Он позволяет запустить 70B-130B модели в F16 (полная точность) или Q8, что недоступно для 24-48 ГБ видеокарт. Скорость (12-14 токенов/с для 70B) достаточна для многих бизнес-задач, где важна не мгновенная реакция, а качество ответа и контекст. Однако для обработки длинных документов (Prompt Eval) M2 Ultra уступает NVIDIA в 10 раз. Если вам нужна скорость — берите NVIDIA. Если нужна емкость памяти для больших моделей без квантования — M2 Ultra.
Итог: Для скорости — NVIDIA (RTX 4090/H100). Для емкости и энергоэффективности на больших моделях — Apple M2 Ultra. Для 7B-13B моделей любая современная RTX 40-й серии или M-серия справится отлично.
Источник: источник (тест/офиц. документация) ↗
