Выбор железа для локального запуска больших языковых моделей (LLM) часто сводится к дилемме: мощные, но дорогие серверные GPU NVIDIA или доступные Apple Mac с унифицированной памятью. Мы проанализировали реальные бенчмарки из репозитория GPU-Benchmarks-on-LLM-Inference, где тестировалась модель LLaMA 3 через llama.cpp. Результаты показывают, что для разных задач есть свои «чемпионы».
01Скорость генерации (Tokens/Second)
Первый и самый важный метрик для пользователя — скорость генерации текста. Ниже приведены данные для генерации 1024 токенов. Обратите внимание: для моделей 70B в F16 большинство GPU выдают OOM (Out Of Memory), так как не хватает видеопамяти.
| Железо | LLaMA 3 8B (Q4_K_M) | LLaMA 3 8B (F16) | LLaMA 3 70B (Q4_K_M) | VRAM (мин.) |
|---|---|---|---|---|
| H100 PCIe 80GB | 144.49 | 67.79 | 25.01 | 80 GB |
| A100 PCIe 80GB | 138.31 | 54.56 | 22.11 | 80 GB |
| RTX 4090 24GB | 127.74 | 54.34 | OOM | 24 GB |
| RTX 6000 Ada 48GB | 130.99 | 51.97 | 18.36 | 48 GB |
| M2 Ultra 192GB | 76.28 | 36.25 | 12.13 | 192 GB |
| M3 Max 64GB | 50.74 | 22.39 | 7.53 | 64 GB |
Как видно, H100 лидирует по чистой скорости генерации для 8B-моделей (144 токена/с). Однако RTX 4090 демонстрирует феноменальную производительность для своего класса, почти догоняя серверные решения в квантованных режимах. Apple M2 Ultra, обладая огромным объемом памяти, показывает respectable результаты (76 токенов/с), что делает его отличным компромиссом для работы с большими моделями, которые не влезают в 24 ГБ VRAM.
02Скорость оценки промпта (Prompt Eval)
Второй метрик — скорость обработки входного контекста (prompt evaluation). Это критично, если вы работаете с длинными документами. Здесь разрыв между NVIDIA и Apple становится еще более очевидным.
| Железо | LLaMA 3 8B (Q4_K_M) | LLaMA 3 70B (Q4_K_M) |
|---|---|---|
| H100 PCIe 80GB | 7760.16 | 984.06 |
| 4090 24GB | 6898.71 | OOM |
| M2 Ultra 192GB | 1023.89 | 117.76 |
| M3 Max 64GB | 678.04 | 62.88 |
RTX 4090 и H100 обрабатывают промпты в 6-7 раз быстрее, чем M2 Ultra. Если ваша задача — анализ огромных баз знаний (RAG), NVIDIA выигрывает безоговорочно. Apple Silicon проигрывает из-за меньшей пропускной способности памяти по сравнению с CUDA-ядрами в этом сценарии.
03Сборка и запуск
Для получения этих результатов используется llama.cpp. Команды сборки и запуска отличаются в зависимости от платформы. Важно правильно указать флаги отгрузки слоев на GPU.
Для NVIDIA GPU:
!make clean && LLAMA_CUBLAS=1 make -jДля Apple Silicon:
!make clean && make -jЗапуск генерации текста с полной отгрузкой на GPU:
!./main -ngl 10000 -m ./models/8B-v3/ggml-model-Q4_K_M.gguf --color --temp 1.1 --repeat_penalty 1.1 -c 0 -n 1024 -e -s 0 -p """\-ngl 10000 для отгрузки всех слоев. Однако обратите внимание: только ~70-78% унифицированной памяти доступно для GPU. Если модель не влезает, система начнет использовать CPU, что резко снизит скорость. Для M1 Max 32GB это ограничение критично.04Какое железо кому подойдёт
Исходя из данных и реалий рынка РФ:
- Бюджетный энтузиаст (до 100-150 тыс. руб.): RTX 4090 (24GB). Лучшее соотношение цена/производительность для 7B-13B моделей. Для 70B Q4_K_M не хватит памяти, но можно попробовать 2x 3090/4090 (если есть место и блок питания).
- Профессионал / Small Business (аренда): RunPod или аналоги. Аренда H100/A100 дает максимальную скорость. Для 70B моделей Q4_K_M H100 выдает 25 токенов/с, что комфортно для работы. RTX 4090 в облаке стоит дешевле, но для 70B Q4_K_M она не подходит (OOM).
- Работа с большими моделями (70B+) на своем железе: Apple Mac Studio с M2 Ultra (192GB RAM). Это единственный способ запустить 70B Q4_K_M локально без облака. Скорость (12 токенов/с) ниже, чем у H100, но модель работает полностью локально и конфиденциально. RTX A6000 (48GB) или 2x RTX 3090 (48GB) — альтернатива, но сложнее в настройке и дороже в покупке б/у.
- Максимальная скорость (Enterprise): H100 PCIe 80GB. Лидер по всем показателям. Доступна только через аренду в облаке, так как стоимость и энергопотребление делают покупку для частных лиц нецелесообразной.
Итог: Если вам нужна скорость обработки промптов и генерации для моделей до 13B — берите NVIDIA RTX 4090. Если нужно запускать 70B+ локально и важна конфиденциальность, а не скорость — выбирайте Mac Studio M2 Ultra. Для тяжелых нагрузок в продакшене — только облачные H100/A100.
Источник: источник (тест/офиц. документация) ↗
