Выбор железа для локального запуска больших языковых моделей (LLM) — это всегда компромисс между скоростью генерации, объемом видеопамяти и доступностью. В свежих бенчмарках от сообщества XiongjieDai протестированы различные конфигурации NVIDIA и Apple Silicon на модели LLaMA 3 с использованием оптимизированного движка llama.cpp. Результаты показывают, что «король горы» не всегда выигрывает в каждой категории, а Apple Silicon демонстрирует удивительную эффективность для своих классов.
01Скорость генерации: Токены в секунду
Главный метрика для пользователя — скорость генерации текста (tokens/s). Тестировалась генерация 1024 токенов. Ниже приведены ключевые результаты для квантованных моделей Q4_K_M (наиболее популярный баланс качества и скорости) и полноразрядных F16.
| Железо | VRAM | LLaMA 3 8B (Q4_K_M) | LLaMA 3 70B (Q4_K_M) |
|---|---|---|---|
| H100 PCIe 80GB | 80 GB | 144.49 | 25.01 |
| RTX 4090 24GB | 24 GB | 127.74 | OOM |
| RTX 6000 Ada 48GB | 48 GB | 130.99 | 18.36 |
| M2 Ultra 192GB | 192 GB | 76.28 | 12.13 |
| M3 Max 64GB | 64 GB | 50.74 | 7.53 |
| A100 SXM 80GB | 80 GB | 133.38 | 24.33 |
Как видно, RTX 4090 (и её серверный аналог RTX 6000 Ada) невероятно быстры в генерации для моделей 8B, почти догоняя H100. Однако для моделей 70B 24GB VRAM недостаточно, и карта выдает ошибку Out Of Memory (OOM). Здесь вступают в игру карты с большим объемом памяти: RTX 6000 Ada (48GB) и A100/H100 (80GB) справляются с 70B-моделями, но скорость генерации падает в 2-3 раза по сравнению с 8B-версией.
Apple M2 Ultra с 192 ГБ унифицированной памяти позволяет запустить 70B-модель со скоростью 12.13 токена/с. Это медленно по сравнению с NVIDIA, но невероятно быстро для ноутбука/стации, не требующей охлаждения серверного уровня.
02Оценка контекста (Prompt Eval)
Скорость обработки входного промпта (prompt eval speed) критична для приложений с длинным контекстом. Здесь разрыв между NVIDIA и Apple становится еще более очевидным.
| Железо | LLaMA 3 8B (Q4_K_M) | LLaMA 3 70B (Q4_K_M) |
|---|---|---|
| H100 PCIe 80GB | 7760.16 | 984.06 |
| RTX 4090 24GB | 6898.71 | OOM |
| M2 Ultra 192GB | 1023.89 | 117.76 |
| M3 Max 64GB | 678.04 | 62.88 |
RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M3 Max. Для 70B модели M2 Ultra показывает 117 токенов/с, что приемлемо для чтения длинных документов, но H100 делает это в 8 раз быстрее (984 токена/с).
03Сборка и настройка llama.cpp
Для получения этих результатов необходимо правильно собрать llama.cpp. Ключевое отличие — использование CUDA для NVIDIA и Metal для Apple Silicon.
Для NVIDIA GPU:
!make clean && LLAMA_CUBLAS=1 make -jДля Apple Silicon:
!make clean && make -jПри запуске важно правильно указать параметры. Флаг -ngl 10000 гарантирует, что все слои модели будут загружены в GPU/VRAM. Если памяти не хватает, модель начнет использовать системную RAM, что резко снизит скорость.
recommendedMaxWorkingSetSize в логах.04VRAM и совместимость моделей
Объем памяти — это не просто цифра, это фильтр доступных моделей. Исходные данные четко показывают границы применимости:
- 8GB VRAM (RTX 3070, M1 8GB): Только модели 7B-8B в квантовании Q4. F16 и 70B — OOM.
- 16-20GB VRAM (RTX 4080, RTX 4000 Ada): 8B в F16 возможна (40-50 токенов/с), но 70B — OOM.
- 24GB VRAM (RTX 3090/4090): Идеально для 8B (Q4/F16). 70B — OOM без свопинга в CPU.
- 48GB VRAM (RTX 6000 Ada, A40, L40S): Комфортный запуск 70B Q4 (~18-24 токена/с). 8B работает на максимуме.
- 80GB+ VRAM (A100, H100): Единственный способ запустить 70B F16 или 8B с огромным контекстом. H100 также позволяет запускать 70B F16 со скоростью 25 токенов/с.
05Какое железо кому подойдёт
Выбор зависит от бюджета и задач. Вот честная разбивка:
1. Бюджетный энтузиаст (До 100-150 тыс. руб.)
Железо: 2x RTX 3090 (б/у) или 1x RTX 4090.
Что запустит: LLaMA 3 8B (очень быстро), LLaMA 3 70B (медленно, с использованием CPU-свопа или 2-карточным режимом). Для 8B модели RTX 4090 дает 127 токенов/с — это уровень продакшена.
2. Профессиональный разработчик / Small Business (500 тыс. - 1 млн руб.)
Железо: Mac Studio M2 Ultra (192GB RAM) или б/у RTX A6000 48GB.
Что запустит: M2 Ultra позволяет запустить 70B модель со скоростью 12 токенов/с. Это медленно для чат-бота, но отлично для анализа документов. RTX A6000 быстрее (14-18 токенов/с для 70B), но требует мощного блока питания и корпуса.
3. Enterprise / High-Performance (Аренда или покупка серверов)
Железо: A100 80GB или H100 80GB (через RunPod/Vast.ai или локально).
Что запустит: H100 — абсолютный лидер. 144 токена/с для 8B и 25 токенов/с для 70B. Если вам нужна скорость обработки промптов (prompt eval), H100 превосходит всё остальное в 5-10 раз. Для РФ сейчас актуальна аренда облачных GPU, так как прямые поставки H100/A100 ограничены, но на рынке есть предложения через посредников.
Итог: Для 8B моделей RTX 4090 — лучший выбор по цене/производительности. Для 70B моделей без облака нужен либо Mac M2 Ultra (для удобства и памяти), либо серверные NVIDIA с 48GB+ VRAM.
Источник: источник (тест/офиц. документация) ↗