Главная/Блог/Обзор/NVIDIA vs Apple Silicon: Тест скорости…
Обзор4 мин чтения · 18 августа 2026 г.

NVIDIA vs Apple Silicon: Тест скорости LLM (LLaMA 3)

Сравнение инференса LLaMA 3 на NVIDIA (RTX 4090, H100) и Apple Silicon (M2 Ultra). Реальные цифры токенов/с и VRAM для выбора железа.

NVIDIA vs Apple Silicon: Тест скорости LLM (LLaMA 3)

Выбор платформы для локального запуска больших языковых моделей (LLM) часто сводится к спору: «купить мощную видеокарту NVIDIA или взять MacBook с Apple Silicon?». Тесты на модели LLaMA 3 через движок llama.cpp дают четкое понимание границ применимости каждого решения. Ниже — разбор реальных данных по скорости генерации (tokens/s) и оценке памяти (VRAM/Unified Memory).

01Скорость генерации: NVIDIA против Apple

Ключевой метрикой для инференса является скорость генерации токенов. В тестах использовалась квантованная модель LLaMA 3 8B (Q4_K_M) и 70B (Q4_K_M). Результаты показывают, что NVIDIA доминирует в абсолютной скорости, но Apple Silicon предлагает удивительную эффективность для своих классов.

Железо Модель Скорость (ток/с) VRAM / Память
RTX 4090 24GB 8B Q4_K_M 127.74 24 GB
RTX 4090 24GB 70B Q4_K_M OOM (Out of Memory) 24 GB
H100 PCIe 80GB 8B Q4_K_M 144.49 80 GB
H100 PCIe 80GB 70B Q4_K_M 25.01 80 GB
M2 Ultra 192GB 8B Q4_K_M 76.28 192 GB
M2 Ultra 192GB 70B Q4_K_M 12.13 192 GB

Как видно, RTX 4090 генерирует текст почти в 2 раза быстрее M2 Ultra на модели 8B. Однако у 4090 критическое ограничение — 24 ГБ VRAM, что делает запуск 70B-моделей невозможным без мульти-GPU конфигураций. M2 Ultra, благодаря 192 ГБ унифицированной памяти, легко тянет 70B-модели, albeit с меньшей скоростью.

⚠️
Важно. Для NVIDIA GPU необходимо собирать llama.cpp с флагом CUDA: LLAMA_CUBLAS=1 make -j. Без этого ускорения не будет. Для Apple Silicon Metal включен по умолчанию: make -j.

02Память и ограничения VRAM

Объем памяти — решающий фактор для выбора модели. В тестах видно, что даже мощные карты вроде RTX 4080 (16GB) и RTX 4000 Ada (20GB) выдают OOM (Out of Memory) на моделях 8B в точности F16 и любых 70B моделях. Для запуска 70B-модели в квантовании Q4 требуется минимум ~40-48 ГБ памяти. Это открывают карты уровня RTX A6000 (48GB), RTX 6000 Ada (48GB), A100 (80GB) и H100 (80GB). На стороне Apple, M1 Max (64GB) справляется с 70B Q4, но скорость падает до 4.09 ток/с. M2 Ultra (192GB) обеспечивает комфортные 12.13 ток/с, что делает его единственным потребительским/профессиональным решением «из коробки» для больших моделей без сложной настройки кластера.

💡
Совет. На Apple Silicon используйте флаг -ngl 10000 для полной загрузки слоев в GPU. Обратите внимание: на M1 Max с 32GB RAM доступно только ~70% памяти для GPU. На M2 Ultra/M3 Max этот лимит выше (~78%), что критично для больших моделей.

03Мульти-GPU конфигурации

Если одной карты не хватает, можно объединять их. Тесты показывают линейный, но не идеальный прирост. Например, 4x RTX 4090 дают 117.61 ток/с на 8B (против 127.74 у одной карты, но с возможностью загрузки больших моделей). Для 70B Q4:

  • 2x RTX 4090: 19.06 ток/с
  • 4x RTX 4090: 18.83 ток/с
  • 8x RTX 4090: 18.76 ток/с
Объединение 8 карт 4090 позволяет запустить 70B F16 (6.45 ток/с), что недоступно на одной карте. Однако стоимость и сложность охлаждения 8 видеокарт делают этот путь экономически нецелесообразным для большинства пользователей по сравнению с арендой облачных инстансов.

04Какое железо кому подойдёт

1. Бюджетный энтузиаст (до 150-200 тыс. руб. / ~$2000): Одна RTX 4090 (24GB). Лучший выбор для моделей 7B-13B. Скорость 127+ ток/с. Для 70B-моделей не подходит. В РФ купить сложно, но возможно через параллельный импорт или б/у рынок.

2. Профессионал / Small Business (до 1 млн руб. / ~$10k+): Mac Studio с M2 Ultra (192GB). Позволяет запускать 70B-модели (12 ток/с) и даже 13B-модели в высокой точности. Это «всё в одном» решение: тишина, низкое энергопотребление, возможность работы с большими контекстами. В РФ доступен через серых поставщиков, цена высока, но это единственное стабильное решение для больших LLM вне облака.

3. Enterprise / Облако: A100/H100. Если нужна скорость 25+ ток/с на 70B-моделях или работа с 400B+ моделями, арендуйте инстансы на RunPod или аналогах. Локально собрать кластер из 4x A100/H100 в РФ крайне дорого и сложно в поддержке. Для инференса 70B Q4 на H100 скорость достигает 25.01 ток/с, что в 2 раза быстрее M2 Ultra.

Итог: Для 8B-моделей берите NVIDIA RTX 4090. Для 70B-моделей без облака — M2 Ultra. Для максимальной скорости 70B+ — облачные H100.

Источник: источник (тест/офиц. документация) ↗