Выбор платформы для локального запуска больших языковых моделей (LLM) — это всегда компромисс между скоростью генерации, объемом памяти и доступностью. Мы проанализировали данные бенчмарков llama.cpp для модели LLaMA 3, сравнив потребительские видеокарты NVIDIA, профессиональные решения (A100/H100) и Apple Silicon. Разница в производительности между сегментами может быть десятикратной, но не всегда оправдывает переплату.
01Скорость генерации: Токены в секунду
Главный показатель для пользователя — скорость генерации текста (tokens/s). Чем выше число, тем быстрее вы получаете ответ. В тестах использовалась квантованная модель 8B (Q4_K_M) и 70B (Q4_K_M). Для моделей 70B в формате FP16 большинство карт выдают Out Of Memory (OOM), поэтому фокус на Q4.
| Железо | VRAM | LLaMA 3 8B (Q4_K_M) | LLaMA 3 70B (Q4_K_M) |
|---|---|---|---|
| RTX 4090 | 24 GB | 127.74 | OOM |
| RTX 4090 * 2 | 48 GB | 122.56 | 19.06 |
| RTX 4090 * 4 | 96 GB | 117.61 | 18.83 |
| RTX 4090 * 8 | 192 GB | 116.13 | 18.76 |
| H100 PCIe | 80 GB | 144.49 | 25.01 |
| H100 PCIe * 4 | 320 GB | 118.14 | 26.20 |
| M2 Ultra | 192 GB | 76.28 | 12.13 |
| M3 Max | 64 GB | 50.74 | 7.53 |
Как видно, одиночная RTX 4090 генерирует текст в 2-3 раза быстрее, чем M2 Ultra с огромным объемом памяти. Однако, 4090 не тянет 70B-модели в одиночку. Для 70B-моделей единственными viable вариантами из списка стали H100, мульти-GPU конфигурации NVIDIA и M2 Ultra. M3 Max (64GB) также не справляется с 70B Q4_K_M в данном тесте (вероятно, из-за ограничений памяти или оптимизации, так как 64GB должно хватить, но тест показывает OOM или низкую скорость, в таблице указано OOM для 70B F16, но для Q4_K_M скорость 7.53 т/с, что очень медленно). Correction based on table: M3 Max 64GB показывает 7.53 токена/с для 70B Q4_K_M, то есть она запускается, но очень медленно. M2 Ultra (192GB) показывает 12.13 т/с. H100 показывает 25.01 т/с. H100 * 4 показывает 26.20 т/с. Увеличение количества H100 не дает линейного прироста скорости генерации для одной модели, так как модель не размещается полностью на одной карте эффективно или ограничена шиной.
02Скорость оценки промпта: Prompt Eval Speed
Это метрика того, как быстро карта «прочитает» ваш длинный запрос (1024 токена). Здесь NVIDIA демонстрирует абсолютное доминирование благодаря высокой пропускной способности памяти и CUDA-ядрам.
| Железо | LLaMA 3 8B (Q4_K_M) | LLaMA 3 70B (Q4_K_M) |
|---|---|---|
| RTX 4090 | 6898.71 | OOM |
| RTX 4090 * 8 | 9706.82 | 1336.26 |
| H100 PCIe * 4 | 11560.23 | 1133.23 |
| M2 Ultra | 1023.89 | 117.76 |
Четыре H100 обрабатывают промпт для 8B модели почти в 11 раз быстрее, чем M2 Ultra. Для 70B модели RTX 4090 * 8 (8 видеокарт) показывает 1336.26 токенов/с на оценку, что сопоставимо с одной H100 (984.06) и лучше, чем H100 * 4 (1133.23) в некоторых метриках, но H100 * 4 выигрывает в скорости генерации (26.20 против 18.76). Это показывает, что для инференса важна не только память, но и вычислительная мощность.
03Сборка и запуск
Для получения этих результатов используется llama.cpp. Компиляция под NVIDIA требует включения CUDA, под Apple Silicon — Metal (включен по умолчанию).
Для NVIDIA GPU
!make clean && LLAMA_CUBLAS=1 make -jДля Apple Silicon
!make clean && make -jПри запуске критически важно правильно указать параметры загрузки. Флаг -ngl 10000 гарантирует, что все слои модели будут загружены в VRAM/Unified Memory. Если оставить -ngl 0, инференс пойдет на CPU, что резко снизит скорость.
recommendedMaxWorkingSetSize в логах. Для использования всей памяти можно попробовать -ngl 0 (только CPU), но это убьет скорость.04Что реально купить/арендовать в РФ
В условиях санкций прямая покупка H100/A100 в РФ затруднена, но их можно арендовать через облачные провайдеры (RunPod, Vast.ai, локальные облака). RTX 4090 доступна в магазинах, но с наценкой. Apple M-серия доступна через параллельный импорт.
- Бюджетный вариант (до 150-200 тыс. руб.): RTX 4090 (24GB). Идеальна для 7B-13B моделей. Тянет 70B в квантовании Q4 только в связке с другими картами или через CPU offload (медленно). M2 MacBook Pro (32GB/96GB) — хороший портативный вариант для 7B-13B, но медленнее 4090.
- Средний сегмент (300-500 тыс. руб.): Две RTX 4090 (48GB суммарно). Позволяют запускать 70B модели с приемлемой скоростью (19 т/с). M2 Ultra (192GB) — король памяти, но медленнее в вычислениях. Подходит для работы с длинными контекстами и большими моделями, если скорость не критична.
- Премиум/Серверный уровень: Аренда H100/A100. Если нужна максимальная скорость для 70B+ моделей, лучше арендовать кластер H100, чем покупать железо. Одна H100 дает 25 т/с для 70B, что в 2 раза быстрее M2 Ultra.
05Какое железо кому подойдёт
- Энтузиасты и разработчики (Бюджет: 150-250 тыс. руб.): Берите RTX 4090. Это лучший баланс цены и скорости для моделей до 13B. Для 70B придется использовать квантование Q2/Q3 или ждать, пока VRAM не станет больше. M3 Max (64GB) — отличная альтернатива, если нужна портативность и тишина, но скорость будет в 2 раза ниже.
- Бизнес и прод (Бюджет: 500 тыс. - 1 млн+ руб.): Конфигурация из 2-4 RTX 4090. Позволяет запускать 70B модели локально. Альтернатива — аренда H100 на почасовой основе, если нагрузка непостоянна. M2 Ultra (192GB) имеет смысл только если вам критически важен объем памяти для очень длинных контекстов (до 100k+ токенов) и вы готовы мириться с низкой скоростью (12 т/с для 70B).
- Корпоративный уровень: Аренда кластеров H100/A100. Для высоких нагрузок и low-latency инференса 70B+ моделей NVIDIA остается безальтернативным лидером. M-серия пока не может конкурировать по скорости генерации на больших моделях.
Итог: Для большинства задач инференса LLM в РФ сегодня оптимальна связка RTX 4090. Apple Silicon — это ниша для работы с памятью и портативности, а не для скорости. H100 — это стандарт для промышленного уровня, но доступен преимущественно через аренду.
Источник: источник (тест/офиц. документация) ↗
