Выбор железа для локального запуска больших языковых моделей (LLM) часто сводится к спору: «купить мощную видеокарту NVIDIA» или «взять MacBook с Apple Silicon». Чтобы не гадать, мы опираемся на реальные бенчмарки из репозитория GPU-Benchmarks-on-LLM-Inference, где тестировалась генерация 1024 токенов в модели LLaMA 3. Данные собраны с использованием llama.cpp на различных конфигурациях: от одиночных RTX 3070 до кластеров из 8xRTX 4090 и серверных H100.
01Скорость генерации: токены в секунду
Главный показатель для пользователя — скорость генерации текста (tokens/s). Чем выше число, тем быстрее вы получаете ответ. Тестировались квантованные модели Q4_K_M (баланс качества и скорости) и полноразрядные F16.
| Железо | 8B Q4_K_M (ток/с) | 70B Q4_K_M (ток/с) | VRAM (ГБ) |
|---|---|---|---|
| RTX 4090 (1x) | 127.74 | OOM (не хватает памяти) | 24 |
| RTX 4090 (2x) | 122.56 | 19.06 | 48 (сумм.) |
| RTX 4090 (4x) | 117.61 | 18.83 | 96 (сумм.) |
| RTX 4090 (8x) | 116.13 | 18.76 | 192 (сумм.) |
| RTX 6000 Ada (1x) | 130.99 | 18.36 | 48 |
| A100 PCIe 80GB (1x) | 138.31 | 22.11 | 80 |
| H100 PCIe 80GB (1x) | 144.49 | 25.01 | 80 |
| M2 Ultra (192GB) | 76.28 | 12.13 | 192 |
| M3 Max (64GB) | 50.74 | 7.53 | 64 |
Как видно, одиночная RTX 4090 выигрывает у M2 Ultra в скорости генерации моделей 8B (127.74 против 76.28 ток/с). Однако для моделей 70B в квантовании Q4 требуется около 40-48 ГБ VRAM. Одиночная 4090 здесь «падает» с ошибкой Out Of Memory (OOM). Чтобы запустить 70B на NVIDIA, нужно минимум две видеокарты (2x24GB), что снижает пиковую скорость до ~19 ток/с. Единичная RTX 6000 Ada (48GB) или A100 (80GB) справляются с 70B быстрее, чем связка из двух 4090.
Apple Silicon M2 Ultra с 192 ГБ памяти позволяет запустить 70B модель без проблем, но скорость генерации (12.13 ток/с) значительно уступает серверным решениям NVIDIA. M3 Max с 64 ГБ памяти также тянет 70B, но медленнее (7.53 ток/с).
LLAMA_CUBLAS=1. Без него вы получите работу только на CPU, что в десятки раз медленнее.02Скорость оценки промпта (Prompt Eval)
Вторая важная метрика — скорость обработки входного текста (prompt evaluation). Это критично, если вы работаете с длинными контекстами. Здесь NVIDIA демонстрирует абсолютное доминирование.
| Железо | 8B Q4_K_M (ток/с) | 70B Q4_K_M (ток/с) |
|---|---|---|
| RTX 4090 (1x) | 6898.71 | OOM |
| RTX 4090 (4x) | 9609.29 | 898.17 |
| H100 (1x) | 7760.16 | 984.06 |
| H100 (4x) | 11560.23 | 1133.23 |
| M2 Ultra | 1023.89 | 117.76 |
Одиночная RTX 4090 обрабатывает промпт для 8B модели почти в 7 раз быстрее, чем M2 Ultra. Для 70B модели одиночная 4090 не подходит из-за нехватки памяти, но даже кластер из 4x4090 уступает единичному H100 в скорости обработки промпта (898 против 984 ток/с).
03Как собрать и запустить
Все тесты проводились через llama.cpp. Команды сборки и запуска стандартны, но требуют внимания к деталям.
Для NVIDIA GPU:
!make clean && LLAMA_CUBLAS=1 make -jДля Apple Silicon (Metal включен по умолчанию):
!make clean && make -jДля принудительной загрузки всех слоев на GPU используйте флаг -ngl 10000. Если вы хотите использовать только CPU, укажите -ngl 0.
-ngl 0), но скорость упадет.04VRAM: сколько нужно для моделей?
Из таблицы видно, что модели 8B в квантовании Q4 помещаются даже в 8 ГБ VRAM (RTX 3070), но скорость там скромная — 70.94 ток/с. Для моделей 70B требуется минимум 40-48 ГБ памяти. Это объясняет, почему одиночные потребительские карты (24 ГБ) не справляются, а профессиональные 48 ГБ (RTX 6000 Ada, A6000) или серверные 80 ГБ (A100, H100) работают стабильно.
Модели 70B в полном формате F16 не помещаются ни в одну из протестированных конфигураций (кроме, возможно, очень медленного CPU-режима или специфических оптимизаций, не охваченных в базовом тесте), так как требуют ~140 ГБ памяти.
05Какое железо кому подойдёт
Выбор зависит от бюджета и задач, доступных на российском рынке (учитывая ограничения на поставки топовых NVIDIA в РФ, актуальны б/у рынки, аренда через RunPod/Vast.ai или использование Apple Silicon).
- Бюджетный энтузиаст (до 100-150 тыс. руб.): Две б/у RTX 3090 (24 ГБ каждая). Итого 48 ГБ VRAM. Вы сможете запускать 70B модели со скоростью ~16-19 ток/с. Это лучший вариант по соотношению цена/VRAM для локального запуска больших моделей.
- Максимальная скорость (бюджет не ограничен): Аренда H100 или A100 через облака. H100 дает 144 ток/с для 8B и 25 ток/с для 70B. Локально купить H100 практически невозможно и нецелесообразно из-за цены и энергопотребления.
- Мобильность и баланс (MacBook Pro): M2 Ultra (192 ГБ) — идеальный вариант для работы с 70B моделями «в поле». Скорость 12 ток/с достаточна для интерактивного общения, а 192 ГБ памяти позволяют держать огромные контексты. M3 Max (64 ГБ) — компромисс: 70B запустится, но медленнее (7.5 ток/с). Для 8B моделей M3 Max/M2 Pro будут очень быстрыми.
- Продакшн-серверы: Кластеры из 4xRTX 4090 или 4xA100. 4x4090 дают ~117 ток/с для 8B и ~18-19 ток/с для 70B. Это дешевле, чем H100, но требует сложной настройки NVLink/CUDA-коммуникации.
Итог: NVIDIA выигрывает в скорости, особенно при наличии достаточного VRAM. Apple Silicon выигрывает в доступности большого объема единой памяти и энергоэффективности, но проигрывает в пропускной способности памяти (bandwidth), что ограничивает скорость генерации.
Источник: источник (тест/офиц. документация) ↗
