Выбор платформы для локального запуска больших языковых моделей (LLM) — это всегда компромисс между ценой, доступностью и производительностью. Мы проанализировали данные бенчмарков llama.cpp для модели LLaMA 3, сравнив потребительские видеокарты NVIDIA, профессиональные решения (A100/H100) и Apple Silicon. Главный вопрос: где вы получите больше токенов в секунду за каждый потраченный рубль?
01Скорость генерации (Tokens/Second)
Скорость генерации — это то, что чувствует пользователь в реальном времени. Чем выше число, тем быстрее модель «думает». В тестах использовалась квантованная версия Q4_K_M и полная точность F16. Обратите внимание: многие карты с малым объемом VRAM просто не могут загрузить большие модели (OOM — Out Of Memory).
| Железо | VRAM | LLaMA 3 8B (Q4_K_M) | LLaMA 3 70B (Q4_K_M) |
|---|---|---|---|
| RTX 4090 (1x) | 24 GB | 127.74 | OOM |
| RTX 4090 (2x) | 48 GB | 122.56 | 19.06 |
| RTX 4090 (4x) | 96 GB | 117.61 | 18.83 |
| RTX 4090 (8x) | 192 GB | 116.13 | 18.76 |
| H100 PCIe (1x) | 80 GB | 144.49 | 25.01 |
| H100 PCIe (4x) | 320 GB | 118.14 | 26.20 |
| M2 Ultra | 192 GB | 76.28 | 12.13 |
| M3 Max | 64 GB | 50.74 | 7.53 |
Как видно, одна RTX 4090 выигрывает у M2 Ultra в скорости генерации 8B-моделей (127 vs 76 токенов/с). Однако для 70B-моделей 4090 требует как минимум двух карт, и скорость падает до ~19 токенов/с. H100 показывает лучший результат для 70B (25-26 токенов/с), но стоит в разы дороже. Apple M2 Ultra с 192 ГБ памяти позволяет запустить 70B-модель, но скорость генерации составляет всего 12.13 токенов/с, что приемлемо для чтения, но медленно для интерактивного диалога.
02Скорость оценки промпта (Prompt Eval)
Это метрика того, как быстро модель «читает» ваш запрос. Высокие значения здесь важны для приложений с длинными контекстами. Здесь NVIDIA демонстрирует абсолютное доминирование.
| Железо | LLaMA 3 8B (Q4_K_M) | LLaMA 3 70B (Q4_K_M) |
|---|---|---|
| RTX 4090 (1x) | 6898.71 | OOM |
| RTX 4090 (8x) | 9706.82 | 1336.26 |
| H100 PCIe (4x) | 11560.23 | 1133.23 |
| M2 Ultra | 1023.89 | 117.76 |
Одна RTX 4090 обрабатывает промпт для 8B-модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B-моделей разрыв еще более впечатляющ: 8x RTX 4090 дают 1336 токенов/с против 117 у M2 Ultra. Apple Silicon уступает NVIDIA в пропускной способности памяти (bandwidth), что критично для этой фазы инференса.
03Сборка и запуск
Для получения этих результатов используется llama.cpp. Компиляция под разные платформы имеет свои нюансы.
Для NVIDIA GPU необходимо включить поддержку CUDA:
!make clean && LLAMA_CUBLAS=1 make -jДля Apple Silicon Metal включен по умолчанию, сборка проще:
!make clean && make -jПри запуске важно правильно указать параметры. Флаг -ngl 10000 гарантирует, что все слои модели будут загружены в GPU/VRAM. Если памяти не хватает, модель начнет использовать CPU, что резко снизит скорость.
recommendedMaxWorkingSetSize.04Реальность рынка РФ: что купить или арендовать?
В условиях импортозамещения и санкций прямая покупка топовых NVIDIA (H100, A100) для частных лиц в РФ практически невозможна. RTX 4090 можно купить, но их цена завышена. Аренда облачных GPU (RunPod, Vast.ai, локальные провайдеры) остается основным способом доступа к мощностям.
- Бюджетный сегмент (RTX 3090/4090): Лучшее соотношение цена/производительность для энтузиастов. 2x RTX 3090 (24GB) — это «народный» вариант для запуска 70B-моделей. В РФ их можно найти на вторичном рынке или собрать сервер.
- Профессиональный сегмент (A100/H100): Доступны только через аренду. H100 показывает рекордные скорости, но стоимость часа аренды высока. Подходит для продакшена и тяжелых нагрузок.
- Apple Silicon: Идеально для портативности и энергоэффективности. M2/M3 Max с 64-192 ГБ памяти позволяют запускать огромные модели локально без интернета. Но скорость генерации (12-26 токенов/с для 70B) ниже, чем у NVIDIA.
05Какое железо кому подойдёт
1. Энтузиаст / Разработчик (Бюджет: 150-300 тыс. руб.)
Выбор: 2x RTX 4090 или 2x RTX 3090 (б/у).
Почему: Это позволит вам запускать LLaMA 3 70B (Q4) с приемлемой скоростью (~19 токенов/с). Для 8B-моделей скорость будет отличной (>120 токенов/с). Это самый быстрый способ получить мощный инференс своими руками в РФ.
2. Бизнес / Продакшен (Бюджет: Аренда GPU)
Выбор: A100 80GB или H100 через облака.
Почему: Если вам нужна стабильность, высокая скорость обработки промптов (Prompt Eval) и возможность масштабирования, аренда H100/A100 выгоднее покупки железа. H100 выдает до 26 токенов/с на 70B-модели, что в 1.5 раза быстрее, чем на 8x RTX 4090.
3. Путешественник / Офис (Бюджет: 200-400 тыс. руб. за Mac)
Выбор: Mac Studio/Pro с M2/M3 Max и 64-192 ГБ памяти.
Почему: Если вам не критична скорость генерации (12-20 токенов/с), но важна автономность, тишина и возможность запускать модели без интернета. M2 Ultra с 192 ГБ памяти — единственный потребительский вариант, который легко тянет 70B-модели в полном объеме без сложной настройки мульти-GPU.
Итог: Для скорости — NVIDIA (RTX 4090/A100/H100). Для портативности и простоты запуска больших моделей — Apple M-серия. Для 8B-моделей одна RTX 4090 разбивает любого конкурента по скорости.
Источник: Официальная документация ↗
