Выбор платформы для локального запуска больших языковых моделей (LLM) — это всегда компромисс между ценой, доступностью и производительностью. Мы проанализировали данные бенчмарков llama.cpp для модели LLaMA 3, чтобы понять, где лучше запускать 8B и 70B модели: на видеокартах NVIDIA или на чипах Apple Silicon. Важно отметить, что тесты проводились с использованием сборки llama.cpp с флагом LLAMA_CUBLAS=1 для NVIDIA и нативным Metal для Apple.
01Скорость генерации (Inference Speed)
Главный метрика для пользователя — скорость генерации токенов (tokens/s). Чем выше число, тем быстрее вы получаете ответ. В таблице ниже приведены средние скорости генерации 1024 токенов для различных конфигураций.
| Железо | 8B Q4_K_M (ток/с) | 70B Q4_K_M (ток/с) | VRAM (ГБ) |
|---|---|---|---|
| H100 PCIe 80GB | 144.49 | 25.01 | 80 |
| RTX 6000 Ada 48GB | 130.99 | 18.36 | 48 |
| RTX 4090 24GB | 127.74 | OOM | 24 |
| M2 Ultra 192GB | 76.28 | 12.13 | 192 |
| M3 Max 64GB | 50.74 | 7.53 | 64 |
| RTX 3090 24GB | 111.74 | OOM | 24 |
Как видно, NVIDIA H100 является абсолютным лидером по скорости генерации для 8B моделей (144.49 ток/с). Однако для 70B моделей даже H100 выдает лишь 25 ток/с, тогда как связка из 8x RTX 4090 (в тесте не указана как единый узел, но логически 4x4090 дают 18.83 ток/с) или специализированные решения могут быть эффективнее в масштабе. RTX 4090 показывает отличные результаты для 8B моделей (127.74 ток/с), но не может запустить 70B модель в квантовании Q4 из-за нехватки VRAM (Out Of Memory).
Apple M2 Ultra с 192 ГБ унифицированной памяти демонстрирует впечатляющую 12.13 ток/с для 70B модели. Это делает его единственным потребительским/профессиональным решением Apple, способным комфортно запускать 70B модели в Q4. M3 Max (64GB) справляется медленнее (7.53 ток/с), но тоже работает.
LLAMA_CUBLAS=1. Без него ускорение через CUDA ядра не будет задействовано, и скорость будет значительно ниже. Для Apple Silicon Metal включен по умолчанию.02Скорость оценки промпта (Prompt Eval)
Вторая важная метрика — скорость обработки входного промпта (tokens/s). Это критично для приложений с длинным контекстом. Здесь разрыв между NVIDIA и Apple становится еще более очевидным.
| Железо | 8B Q4_K_M (ток/с) | 70B Q4_K_M (ток/с) |
|---|---|---|
| H100 PCIe 80GB | 7760.16 | 984.06 |
| RTX 4090 24GB | 6898.71 | OOM |
| M2 Ultra 192GB | 1023.89 | 117.76 |
| M3 Max 64GB | 678.04 | 62.88 |
RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B моделей RTX 4090 снова упирается в VRAM. M2 Ultra обрабатывает 70B промпт со скоростью 117.76 ток/с, что приемлемо, но значительно медленнее, чем решения NVIDIA.
03VRAM и совместимость
Объем видеопамяти — критический ограничитель. В тестах многие конфигурации помечены как OOM (Out Of Memory), что означает нехватку памяти для загрузки модели.
- 8B модели (Q4): Требуют ~6-8 ГБ VRAM. Легко запускаются на RTX 3070, 3080, 4070 Ti, M1, M3 Max.
- 70B модели (Q4): Требуют ~40-48 ГБ VRAM. Здесь лидируют RTX A6000 (48GB), RTX 6000 Ada (48GB), A100 (80GB), H100 (80GB) и M2 Ultra (192GB). Обычные игровые карты (RTX 3090/4090 по 24GB) не справляются с 70B в одиночку.
- 70B модели (F16): Требуют ~140 ГБ VRAM. Запускаются только на конфигурациях с 6x24GB (3090), 8x24GB (4090), 4x48GB (A6000/6000 Ada), 4x80GB (A100/H100) и M2 Ultra (192GB).
Для Apple Silicon есть нюанс: только 70% унифицированной памяти доступно для GPU на M1 Max (32GB), и около 78% на более новых чипах. Это нужно учитывать при планировании загрузки моделей.
-ngl 0, но это резко снизит скорость. Для GPU-ускорения объем памяти ограничен системными ограничениями Metal.04Реальность для РФ: что купить или арендовать?
В условиях санкций прямая покупка NVIDIA H100/A100 в РФ затруднена, а цены на б/у или «серые» поставки завышены. Однако инференс LLM можно эффективно организовать иначе:
- Аренда GPU (Cloud): Платформы вроде RunPod (упоминается в источнике) или российские аналоги (Vast.ai аналоги, Selectel, Yandex Cloud) позволяют арендовать H100/A100 по часам. Для тяжелых 70B+ моделей это часто выгоднее покупки железа.
- RTX 4090/3090: Легко доступны в РФ. Для 8B моделей это лучший выбор по цене/производительности. Для 70B моделей потребуется связка из 2-4 карт, что дорого и требует мощного блока питания и материнской платы с достаточным числом PCIe линий.
- Apple Mac Studio/Pro: M2 Ultra доступен через импортеров. Это единственное решение «всё в одном» для запуска 70B моделей без сложной настройки мульти-GPU. M3 Max (64GB) — хороший компромисс для 8B и легких 70B (в Q4).
05Какое железо кому подойдёт
- Бюджетный энтузиаст (до 100 тыс. руб.): RTX 3090/4090 (б/у или новая). Отлично для 8B моделей (Llama-3-8B, Mistral-7B). Скорость генерации 100-120 ток/с. 70B модели не запустятся.
- Продвинутый пользователь (150-300 тыс. руб.): Две RTX 4090 или RTX 3090. Позволяет запускать 70B модели в Q4 (скорость ~16-19 ток/с). Требует тщательной настройки PCIe и питания.
- Профессионал/Бизнес (высокий бюджет): Аренда H100/A100 в облаке для тяжелых задач. Или покупка Mac Studio M2 Ultra (если доступен) для автономной работы с 70B моделями (12 ток/с). Для 8B моделей M2 Ultra медленнее NVIDIA, но выигрывает в энергоэффективности и тишине.
- Максимальная скорость (неограниченный бюджет): Связка 4x H100 или 4x RTX 6000 Ada. Для 70B моделей это дает до 26 ток/с (H100) и до 1133 ток/с для оценки промпта.
Итог: для 8B моделей NVIDIA RTX 4090 безоговорочно быстрее. Для 70B моделей выбор стоит между сложной мульти-GPU сборкой на NVIDIA (RTX 4090/3090) и удобным, но более медленным Apple M2 Ultra. H100 остается эталоном, но доступен только через облака.
Источник: источник (тест/офиц. документация) ↗