Главная/Блог/Обзор/LLM на AMD Radeon: Сборка llama.cpp…
Обзор4 мин чтения · 19 августа 2026 г.

LLM на AMD Radeon: Сборка llama.cpp через ROCm и Vulkan

Разбираем, как запустить инференс LLM на видеокартах AMD в Linux. Разбор флагов сборки HIP/Vulkan, подводные камни ROCm и выбор железа для РФ.

Запуск больших языковых моделей (LLM) на видеокартах AMD в среде Linux — это не просто альтернатива NVIDIA, а часто единственно возможный путь для владельцев бюджетных или специфичных GPU. Проект llama.cpp предоставляет гибкий инструментарий для компиляции под разные бэкенды, включая HIP (ROCm) и Vulkan. Однако, в отличие от «из коробки» работающего CUDA, AMD-решения требуют внимательной настройки зависимостей и понимания архитектуры сборки.

01Подготовка окружения и базовая сборка

Первый шаг — получение исходного кода. Проект активно развивается, поэтому актуальная версия всегда доступна в репозитории ggml-org/llama.cpp. Для начала работы достаточно клонировать репозиторий и перейти в папку проекта:

terminalbash
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

Базовая сборка через CMake позволяет скомпилировать проект под CPU. Это полезно для тестирования или если у вас нет совместимого GPU. Команда ниже создаст директорию build и запустит релизную сборку:

terminalbash
cmake -B build
cmake --build build --config Release

Для ускорения компиляции на многоядерных процессорах рекомендуется использовать флаг -j или генератор Ninja. Также полезно установить ccache для кэширования результатов компиляции при повторных сборках.

02GPU-бэкенды: HIP (ROCm) и Vulkan

Для использования видеокарт AMD (Radeon RX 6000/7000 series, Radeon Pro) в Linux основным методом является использование HIP (платформа, совместимая с ROCm). Vulkan выступает как универсальная альтернатива, поддерживаемая многими GPU, включая некоторые мобильные и старые десктопные модели, но с потенциально меньшим оверхолдом производительности на сложных моделях.

Сборка с поддержкой ROCm (HIP)

Чтобы включить ускорение на AMD GPU, необходимо явно указать флаг GGML_HIP=ON. Важно: ROCm требует специфических библиотек и драйверов, которые обычно доступны только в дистрибутивах Linux (Ubuntu, Fedora, Arch). На Windows поддержка ROCm ограничена и часто требует WSL2 с дополнительными настройками.

terminalbash
cmake -B build -DGGML_HIP=ON
cmake --build build --config Release

Если вы сталкиваетесь с ошибками компиляции, убедитесь, что переменные окружения ROCm (такие как HIP_PATH) корректно настроены. В некоторых дистрибутивах (например, Fedora) могут потребоваться дополнительные пакеты rocm-dev и rocm-libs.

Сборка с поддержкой Vulkan

Vulkan-бэкенд часто проще в установке, так как не требует специфичных для AMD стеков драйверов, а использует общие Vulkan-драйверы (Mesa). Это может быть полезно для тестирования на GPU, которые не полностью поддерживаются ROCm, или для кросс-платформенных сборок.

terminalbash
cmake -B build -DGGML_VULKAN=ON
cmake --build build --config Release
⚠️
Важно. Совместимость ROCm с GPU. Не все видеокарты AMD поддерживаются ROCm официально. Обычно поддерживаются серии RX 5000, 6000, 7000 и профессиональные Radeon Pro. Старые карты (RX 400/500) могут требовать эмуляции или не работать вовсе. Проверяйте список совместимости на сайте AMD перед покупкой.

03Оптимизация и BLAS

Для ускорения обработки промптов (prompt processing) при больших батчах можно подключить библиотеку BLAS. Это не влияет на скорость генерации токенов, но ускоряет начальную фазу. Для AMD-систем часто используется OpenBLAS или Intel oneMKL (если есть процессоры Intel с поддержкой AVX512/VNNI, но не для GPU).

Пример сборки с OpenBLAS:

terminalbash
cmake -B build -DGGML_BLAS=ON -DGGML_BLAS_VENDOR=OpenBLAS
cmake --build build --config Release

Для процессоров Intel также доступна сборка через oneAPI, что дает прирост на CPU, но не заменяет GPU-ускорение. Для Intel GPU (Arc, Max Series) следует использовать бэкенд SYCL, а не HIP.

💡
Совет. Если вы используете AMD Radeon на Linux, убедитесь, что используете актуальные драйверы amdgpu и ROCm. Старые версии ROCm могли иметь проблемы с совместимостью с новыми ядрами Linux. Рекомендуется использовать актуальные версии ROCm для современных GPU.

04VRAM и выбор моделей

Объем видеопамяти (VRAM) — критический параметр. llama.cpp использует квантование (GGUF), что позволяет запускать большие модели на меньшем объеме памяти. Примерные требования для инференса (с учетом контекста):

  • 7B-13B модели (Q4_K_M): ~5-8 ГБ VRAM. Подойдут карты с 8 ГБ (RX 6600, RX 7600) для легких задач.
  • 30B-70B модели (Q4_K_M): ~20-40 ГБ VRAM. Требуют карт уровня RX 6900 XT / 7900 XTX (24 ГБ) или профессиональных Radeon Pro с 32+ ГБ. Для 70B часто требуется несколько GPU или CPU-инференс.
  • Большие модели (100B+): Обычно требуют CPU-инференса или серверных GPU (NVIDIA A100/H100), так как VRAM потребительских AMD карт ограничена.

В России купить новые AMD Radeon RX 7000 серии можно, но цены часто выше мировых. Аренда GPU в облаках (Yandex Cloud, Selectel) с AMD-картами встречается реже, чем NVIDIA, но становится доступнее через специализированные AI-платформы.

05Какое железо кому подойдёт

  • Бюджетный старт (до 30 000 руб.): AMD Radeon RX 6600 (8 ГБ). Подходит для моделей до 7B в квантовании Q4. Сборка через Vulkan или HIP (если драйверы работают). Отличный входной билет в мир LLM.
  • Средний сегмент (50 000 - 80 000 руб.): AMD Radeon RX 6700 XT / 6750 XT (12 ГБ) или RX 7600 (8 ГБ, но

    Источник: источник (тест/офиц. документация) ↗