Выбор железа для локального запуска больших языковых моделей (LLM) часто сводится к спору: «купить мощную видеокарту NVIDIA или собрать Mac Studio с унифицированной памятью»? Тесты на модели LLaMA 3 через движок llama.cpp дают четкие ответы. Ниже — разбор реальных данных по скорости генерации (tokens/s) и оценке контекста, а также практические советы для российских пользователей.
01Скорость генерации: NVIDIA против Apple
Главный метрика для инференса — скорость генерации токенов. В тестах использовалась модель LLaMA 3 с квантованием Q4_K_M (наиболее популярный баланс качества и скорости). Данные собраны для генерации 1024 токенов.
Однокарточные решения NVIDIA доминируют в сегменте 8B-моделей. RTX 4090 (24GB) выдает 127.74 токена/с, что почти в 2.5 раза быстрее, чем флагман Apple M2 Ultra (76-Core GPU, 192GB) со скоростью 76.28 токена/с. Однако Apple Silicon выигрывает за счет объема памяти: M2 Ultra позволяет запускать модели 70B, которые физически не влезают в одну RTX 4090.
Для моделей 70B (Q4_K_M) ситуация меняется:
- H100 PCIe 80GB: 25.01 ток/с (лидер по скорости).
- RTX 6000 Ada 48GB: 18.36 ток/с.
- M2 Ultra 192GB: 12.13 ток/с.
- M3 Max 64GB: 7.53 ток/с (OOM для F16).
Обратите внимание: многие карты NVIDIA (3070, 3080, 4070 Ti) выдают OOM (Out Of Memory) на моделях 70B, так как им не хватает VRAM даже для квантованных версий. M2 Ultra с 192GB памяти позволяет запустить 70B F16 (4.71 ток/с), что недоступно для большинства потребительских GPU NVIDIA.
02Скорость оценки контекста (Prompt Eval)
Этот показатель важен для скорости «подогрева» контекста (processing input). Здесь разрыв между NVIDIA и Apple еще более заметен. RTX 4090 обрабатывает 8B Q4_K_M со скоростью 6898.71 ток/с, в то время как M2 Ultra — всего 1023.89 ток/с. H100 в кластере из 4 штук достигает феноменальных 11560.23 ток/с.
| Железо | Модель | Генерация (ток/с) | VRAM / Примечание |
|---|---|---|---|
| RTX 4090 24GB | LLaMA 3 8B Q4_K_M | 127.74 | Влезает полностью |
| M2 Ultra 192GB | LLaMA 3 70B Q4_K_M | 12.13 | Влезает полностью |
| H100 PCIe 80GB | LLaMA 3 70B Q4_K_M | 25.01 | Влезает полностью |
| RTX 4090 24GB * 8 | LLaMA 3 70B F16 | 6.45 | Мультитеенанси |
03Сборка и запуск llama.cpp
Для получения этих результатов необходимо правильно собрать llama.cpp. Флаги сборки критичны для производительности.
Для NVIDIA GPU требуется поддержка CUDA:
!make clean && LLAMA_CUBLAS=1 make -jДля Apple Silicon Metal включен по умолчанию, но сборка выглядит проще:
!make clean && make -jПри запуске важно правильно указать параметры. Флаг -ngl 10000 гарантирует, что все слои модели будут загружены в память GPU/Unified Memory. Если использовать -ngl 0, инференс пойдет только на CPU, что резко снизит скорость.
04Что реально купить/арендовать в РФ
В условиях санкций прямые поставки NVIDIA в РФ затруднены, но рынок насыщен:
- RTX 4090 (24GB): Самый популярный вариант для энтузиастов. Цена на вторичном рынке или у серых импортеров высока, но это лучший выбор для 8B-моделей. Для 70B-моделей одной карты мало.
- RTX 3090 (24GB): Бюджетная альтернатива. Часто продается б/у. Позволяет запускать 70B Q4_K_M, но со скоростью ~111 ток/с (8B) и ~16 ток/с (70B). Отличный входной билет в мир больших моделей.
- Mac Studio M2 Ultra: Доступен в РФ, но по завышенным ценам. Выигрывает только если вам нужен объем памяти 192GB для запуска 70B-моделей без квантования или с минимальной потерей качества. Скорость инференса значительно ниже, чем у NVIDIA.
- Аренда (RunPod/Vast.ai): Для тяжелых задач (70B+ или кластеры) выгоднее арендовать H100/A100. H100 PCIe 80GB дает 25 ток/с на 70B Q4, что в 2 раза быстрее M2 Ultra. Для 8B моделей H100 выдает 144 ток/с.
05Какое железо кому подойдёт
- Бюджетный энтузиаст (до 100-150 тыс. руб.): RTX 3090 (б/у). 24GB VRAM позволяют запускать 70B Q4_K_M. Скорость приемлемая, но для мульти-GPU нужно две карты.
- Продвинутый пользователь (150-250 тыс. руб.): RTX 4090. Лучшая скорость для 8B-моделей (127+ ток/с). Для 70B-моделей одной карты недостаточно, нужен мульти-GPU или квантование до Q2/Q3 (с потерей качества).
- Корпоративный сегмент / Серверы: A100/H100 через аренду. H100 PCIe 80GB — король скорости (25 ток/с на 70B Q4). В РФ купить новые сложно, но аренда на RunPod или локальных облаках решает задачу.
- Максималисты по памяти: Mac Studio M2 Ultra (192GB). Единственный вариант «из коробки» для запуска 70B F16 (полная точность) на одном устройстве, albeit с низкой скоростью (4.71 ток/с). Подходит для разработки и тестирования, где важна точность, а не скорость ответа.
Итог: NVIDIA выигрывает в скорости и экосистеме (CUDA). Apple Silicon выигрывает в объеме памяти на чип и энергоэффективности, но проигрывает в вычислительной мощности для инференса LLM.
Источник: источник (тест/офиц. документация) ↗
