Выбор платформы для локального запуска больших языковых моделей (LLM) часто сводится к спору: «купить мощную видеокарту NVIDIA или взять MacBook с Apple Silicon?». Тесты на модели LLaMA 3 через движок llama.cpp дают четкое понимание границ применимости каждого решения. Ниже — разбор реальных данных по скорости генерации (tokens/s) и оценке памяти (VRAM/Unified Memory).
01Скорость генерации: NVIDIA против Apple
Ключевой метрикой для инференса является скорость генерации токенов. В тестах использовалась квантованная модель LLaMA 3 8B (Q4_K_M) и 70B (Q4_K_M). Результаты показывают, что NVIDIA доминирует в абсолютной скорости, но Apple Silicon предлагает удивительную эффективность для своих классов.
| Железо | Модель | Скорость (ток/с) | VRAM / Память |
|---|---|---|---|
| RTX 4090 24GB | 8B Q4_K_M | 127.74 | 24 GB |
| RTX 4090 24GB | 70B Q4_K_M | OOM (Out of Memory) | 24 GB |
| H100 PCIe 80GB | 8B Q4_K_M | 144.49 | 80 GB |
| H100 PCIe 80GB | 70B Q4_K_M | 25.01 | 80 GB |
| M2 Ultra 192GB | 8B Q4_K_M | 76.28 | 192 GB |
| M2 Ultra 192GB | 70B Q4_K_M | 12.13 | 192 GB |
Как видно, RTX 4090 генерирует текст почти в 2 раза быстрее M2 Ultra на модели 8B. Однако у 4090 критическое ограничение — 24 ГБ VRAM, что делает запуск 70B-моделей невозможным без мульти-GPU конфигураций. M2 Ultra, благодаря 192 ГБ унифицированной памяти, легко тянет 70B-модели, albeit с меньшей скоростью.
LLAMA_CUBLAS=1 make -j. Без этого ускорения не будет. Для Apple Silicon Metal включен по умолчанию: make -j.02Память и ограничения VRAM
Объем памяти — решающий фактор для выбора модели. В тестах видно, что даже мощные карты вроде RTX 4080 (16GB) и RTX 4000 Ada (20GB) выдают OOM (Out of Memory) на моделях 8B в точности F16 и любых 70B моделях. Для запуска 70B-модели в квантовании Q4 требуется минимум ~40-48 ГБ памяти. Это открывают карты уровня RTX A6000 (48GB), RTX 6000 Ada (48GB), A100 (80GB) и H100 (80GB). На стороне Apple, M1 Max (64GB) справляется с 70B Q4, но скорость падает до 4.09 ток/с. M2 Ultra (192GB) обеспечивает комфортные 12.13 ток/с, что делает его единственным потребительским/профессиональным решением «из коробки» для больших моделей без сложной настройки кластера.
-ngl 10000 для полной загрузки слоев в GPU. Обратите внимание: на M1 Max с 32GB RAM доступно только ~70% памяти для GPU. На M2 Ultra/M3 Max этот лимит выше (~78%), что критично для больших моделей.03Мульти-GPU конфигурации
Если одной карты не хватает, можно объединять их. Тесты показывают линейный, но не идеальный прирост. Например, 4x RTX 4090 дают 117.61 ток/с на 8B (против 127.74 у одной карты, но с возможностью загрузки больших моделей). Для 70B Q4:
- 2x RTX 4090: 19.06 ток/с
- 4x RTX 4090: 18.83 ток/с
- 8x RTX 4090: 18.76 ток/с
04Какое железо кому подойдёт
1. Бюджетный энтузиаст (до 150-200 тыс. руб. / ~$2000): Одна RTX 4090 (24GB). Лучший выбор для моделей 7B-13B. Скорость 127+ ток/с. Для 70B-моделей не подходит. В РФ купить сложно, но возможно через параллельный импорт или б/у рынок.
2. Профессионал / Small Business (до 1 млн руб. / ~$10k+): Mac Studio с M2 Ultra (192GB). Позволяет запускать 70B-модели (12 ток/с) и даже 13B-модели в высокой точности. Это «всё в одном» решение: тишина, низкое энергопотребление, возможность работы с большими контекстами. В РФ доступен через серых поставщиков, цена высока, но это единственное стабильное решение для больших LLM вне облака.
3. Enterprise / Облако: A100/H100. Если нужна скорость 25+ ток/с на 70B-моделях или работа с 400B+ моделями, арендуйте инстансы на RunPod или аналогах. Локально собрать кластер из 4x A100/H100 в РФ крайне дорого и сложно в поддержке. Для инференса 70B Q4 на H100 скорость достигает 25.01 ток/с, что в 2 раза быстрее M2 Ultra.
Итог: Для 8B-моделей берите NVIDIA RTX 4090. Для 70B-моделей без облака — M2 Ultra. Для максимальной скорости 70B+ — облачные H100.
Источник: источник (тест/офиц. документация) ↗
