Выбор платформы для локального запуска больших языковых моделей (LLM) — это всегда компромисс между ценой, доступностью и производительностью. Мы проанализировали реальные бенчмарки из репозитория GPU-Benchmarks-on-LLM-Inference, где тестировалась модель LLaMA 3 (8B и 70B) через llama.cpp. Сравнение проведено между серверными GPU NVIDIA (от RTX 3070 до H100) и мобильными/рабочими чипами Apple Silicon (M1, M2, M3 Max/Ultra).
01Скорость генерации: Токены в секунду
Главный метрика для пользователя — скорость генерации текста (tokens/s). Ниже приведены данные для генерации 1024 токенов. Обратите внимание: для моделей 70B в формате FP16 большинство GPU выдают ошибку OOM (Out Of Memory), так как не хватает видеопамяти.
| Железо | 8B Q4_K_M (ток/с) | 70B Q4_K_M (ток/с) | VRAM (прибл.) |
|---|---|---|---|
| RTX 4090 24GB | 127.74 | OOM | ~6-8 GB (для 8B) |
| RTX 4090 24GB * 2 | 122.56 | 19.06 | ~40 GB (для 70B) |
| RTX 6000 Ada 48GB | 130.99 | 18.36 | ~40 GB (для 70B) |
| H100 PCIe 80GB | 144.49 | 25.01 | ~40 GB (для 70B) |
| H100 PCIe 80GB * 4 | 118.14 | 26.20 | >100 GB (для 70B) |
| M2 Ultra 192GB | 76.28 | 12.13 | ~40-48 GB (для 70B) |
| M3 Max 64GB | 50.74 | 7.53 | ~40 GB (для 70B) |
Как видно, одна RTX 4090 генерирует текст в 2-3 раза быстрее, чем M2 Ultra (76.28 vs 127.74 ток/с для 8B). Однако Apple Silicon выигрывает в объеме памяти: M2 Ultra имеет 192 ГБ унифицированной памяти, что позволяет запускать огромные модели (например, 70B в квантованном виде) без необходимости кластеризации нескольких GPU, как это часто требуется для NVIDIA.
02Оценка промпта (Prompt Eval)
Скорость обработки входного контекста (prompt evaluation) критична для приложений с длинными документами. Здесь разрыв между NVIDIA и Apple еще заметнее.
| Железо | 8B Q4_K_M (ток/с) | 70B Q4_K_M (ток/с) |
|---|---|---|
| RTX 4090 24GB | 6898.71 | OOM |
| H100 PCIe 80GB | 7760.16 | 984.06 |
| M2 Ultra 192GB | 1023.89 | 117.76 |
| M3 Max 64GB | 678.04 | 62.88 |
RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B модели H100 показывает 984 ток/с, тогда как M2 Ultra — лишь 117 ток/с. NVIDIA безоговорочно лидирует в скорости вычислений.
03Как собрать и запустить
Для получения этих результатов используется llama.cpp. Команды сборки различаются в зависимости от платформы.
Для NVIDIA GPU (с поддержкой CUDA):
!make clean && LLAMA_CUBLAS=1 make -jДля Apple Silicon (Metal):
!make clean && make -jДля загрузки всех слоев модели на GPU используется флаг -ngl 10000. Если вы хотите использовать только CPU, укажите -ngl 0.
04VRAM и совместимость моделей
Объем видеопамяти (VRAM) — это «бутылочное горлышко» для запуска больших моделей. Вот примерное распределение:
- 8B модели (Q4_K_M): требуют ~6-8 ГБ VRAM. Подходят RTX 3070, 4070 Ti, M1/M2 базовые версии.
- 70B модели (Q4_K_M): требуют ~40-48 ГБ VRAM. Здесь нужны RTX 4090 (в связке 2 шт.), RTX 6000 Ada, A100/H100 или M2 Ultra/M3 Max с большим объемом памяти.
- Модели 70B (FP16): требуют >140 ГБ VRAM. Доступны только на конфигурациях из 4x H100 или 4x A100. Обычные потребительские видеокарты здесь бессильны.
05Какое железо кому подойдёт
Выбор зависит от вашего бюджета и задач в условиях российского рынка:
- Бюджетный сегмент (До 100-150 тыс. руб.): RTX 4090 (24GB) или RTX 3090 (24GB). Это лучший выбор для локального инференса 8B-13B моделей. RTX 4090 быстрее, но 3090 можно найти б/у дешевле. M1/M2 MacBook Air/Pro с 8-16 ГБ памяти подойдут только для очень легких моделей (до 7B в сильном квантовании) и будут работать медленно.
- Профессиональный сегмент (300-500 тыс. руб.): RTX 4080 (16GB) или RTX 4000 Ada (20GB). Позволяют запускать 8B модели в FP16. Для 70B моделей этого объема мало, но можно рассмотреть связку из двух карт. Apple MacBook Pro M3 Max (64GB/96GB) — отличная альтернатива, если важна мобильность и энергоэффективность, но скорость будет ниже NVIDIA в 2-3 раза.
- High-End / Серверный сегмент (от 1 млн руб.): RTX 6000 Ada (48GB) или аренда A100/H100 на облачных платформах (RunPod, Vast.ai и др., доступных через посредников в РФ). Для запуска 70B моделей в реальном времени с высокой скоростью нужна RTX 6000 Ada или связка из двух RTX 4090. M2 Ultra (Mac Studio) — уникальный вариант, позволяющий запустить 70B модель на одном устройстве с приемлемой скоростью (12 ток/с), что недоступно на большинстве потребительских GPU NVIDIA из-за нехватки VRAM.
Итог: Для максимальной скорости генерации берите NVIDIA RTX 4090/4000 Ada. Для запуска самых больших моделей (70B+) на одном устройстве без сложной настройки кластера — Apple M2/M3 Ultra. В России сейчас проще всего арендовать NVIDIA GPU через облака, так как прямые поставки серверного оборудования ограничены.
Источник: источник (тест/офиц. документация) ↗
