Выбор железа для локального запуска больших языковых моделей (LLM) часто сводится к дилемме: мощные, но дорогие GPU NVIDIA или энергоэффективные чипы Apple Silicon. Мы проанализировали реальные данные бенчмарков GPU-Benchmarks-on-LLM-Inference, где тестировалась генерация 1024 токенов в модели LLaMA 3. Результаты показывают четкое разделение сфер применения: NVIDIA доминирует в скорости, а Apple Silicon предлагает уникальный баланс памяти и портативности.
01Скорость генерации (Tokens/Second)
Ключевой метрикой для пользователя является скорость генерации текста. В тестах использовалась сборка llama.cpp с оптимизациями BLAS. Ниже приведены данные по скорости генерации (не оценки промпта) для квантованных (Q4_K_M) и полноразрядных (F16) моделей.
| Железо | LLaMA 3 8B (Q4_K_M) | LLaMA 3 70B (Q4_K_M) | VRAM (прибл.) |
|---|---|---|---|
| H100 PCIe 80GB | 144.49 | 25.01 | 80 GB |
| RTX 4090 24GB | 127.74 | OOM (Out of Memory) | 24 GB |
| RTX 4090 24GB * 2 | 122.56 | 19.06 | 48 GB |
| RTX 4090 24GB * 4 | 117.61 | 18.83 | 96 GB |
| RTX 4090 24GB * 8 | 116.13 | 18.76 | 192 GB |
| M2 Ultra 192GB | 76.28 | 12.13 | 192 GB |
| M3 Max 64GB | 50.74 | 7.53 | 64 GB |
| M1 Max 64GB | 34.49 | 4.09 | 64 GB |
Как видно, H100 обеспечивает максимальную скорость, но для локального использования чаще применяются RTX 4090. Важно отметить: одна RTX 4090 (24 ГБ) не может запустить LLaMA 3 70B даже в квантовании Q4 из-за нехватки памяти (OOM). Для запуска 70B-моделей на NVIDIA требуется мульти-GPU конфигурация (минимум 2x4090 для Q4, 4x4090 для комфортной работы) или профессиональные карты типа A6000 (48GB) / H100 (80GB).
Apple M2 Ultra с 192 ГБ унифицированной памяти демонстрирует впечатляющие 76.28 токенов/с для 8B модели и 12.13 токенов/с для 70B. Это делает Mac Studio с M2 Ultra одним из самых доступных решений для запуска 70B-моделей «из коробки» без сложной настройки распределения по нескольким GPU.
02Скорость оценки промпта (Prompt Eval)
Если вы работаете с длинными контекстами, важна скорость обработки входных данных (prompt evaluation). Здесь разрыв между NVIDIA и Apple еще заметнее.
| Железо | LLaMA 3 8B (Q4_K_M) | LLaMA 3 70B (Q4_K_M) |
|---|---|---|
| H100 PCIe 80GB | 7760.16 | 984.06 |
| RTX 4090 24GB | 6898.71 | OOM |
| RTX 4090 24GB * 8 | 9706.82 | 1336.26 |
| M2 Ultra 192GB | 1023.89 | 117.76 |
| M3 Max 64GB | 678.04 | 62.88 |
Одна RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B модели разница еще более драматична: 8x RTX 4090 выдают 1336 токенов/с на этапе оценки, тогда как M2 Ultra — всего 117.76. Это критично для приложений с длинными документами, где время ожидания первого токена (TTFT) напрямую влияет на UX.
03Сборка и запуск
Для получения этих результатов используется llama.cpp. Команды сборки и запуска просты, но требуют понимания флагов.
Сборка для NVIDIA (с поддержкой CUDA):
!make clean && LLAMA_CUBLAS=1 make -jСборка для Apple Silicon (Metal включен по умолчанию):
!make clean && make -jДля принудительной загрузки всех слоев модели на GPU используется флаг -ngl 10000. Если вы хотите использовать только CPU, укажите -ngl 0.
recommendedMaxWorkingSetSize. Это подскажет, сколько памяти реально доступно GPU. Если модель не влезает, часть слоев будет выгружена в CPU-память, что резко снизит скорость.04Какое железо кому подойдёт
Выбор зависит от бюджета и задач. Вот честная разбивка на основе данных:
- Бюджетный энтузиаст (до 150-200 тыс. руб. за систему): RTX 4090 (24GB). Идеально для моделей до 13B-30B. Для 70B моделей придется либо мириться с медленным CPU-инференсом, либо собирать систему из 2-4 видеокарт, что дорого и сложно в охлаждении.
- Профессиональный локальный сервер (высокий бюджет): 4x RTX 4090 или 2x RTX 6000 Ada (48GB). Это позволит запускать 70B модели с высокой скоростью (18-26 токенов/с). В РФ такие системы можно собрать самостоятельно, но аренда H100/A100 на RunPod часто выгоднее для эпизодических тяжелых задач.
- Максимальная компактность и память (Mac Studio): M2 Ultra (192GB). Лучший выбор, если вам нужно запускать 70B-130B модели локально, но вы не готовы собирать сервер на 8 видеокартах. Скорость (12-13 токенов/с для 70B) достаточна для интерактивного общения, но не для высоконагруженных сервисов. M3 Max (64GB) хорош для 8B-30B моделей, но 70B в нем работает медленно (7.5 токенов/с) и с риском нехватки памяти.
В России купить новые H100/A100 сложно из-за санкций, поэтому основной рынок — это RTX 40-й серии и б/у профессиональные карты (A6000). Apple Silicon остается стабильным и доступным вариантом для работы с большими моделями благодаря унифицированной памяти.
Источник: источник (тест/офиц. документация) ↗
