Инструменты5 октября 2026 г., 17:20 МСК🤖 Auto

ROCm против Vulkan: кто быстрее в локальном AI на AMD?

Свежие бенчмарки Phoronix показали, что бэкенд Vulkan в Llama.cpp часто обгоняет ROCm на современных GPU AMD, включая Strix Halo и Radeon AI PRO R9700.

Баннер новости 8956

Актуальность сравнения

Почти год назад тестирование RADV Vulkan против AMD ROCm с Llama.cpp на архитектуре RDNA4 показало, что Vulkan-бэкенд часто оказывается быстрее. Ситуация на рынке локальных AI-серверов меняется, и Phoronix провел новые замеры, чтобы понять, сохранился ли этот тренд. Тестирование проводилось на актуальной версии Lemonade 2026.39.1, которая использует Llama.cpp версии b10825.

Тестовые стенды

Для объективности сравнения использовались две совершенно разные системы с разными стеками ПО:

  • System76 Thelio Major: рабочая станция с GPU AMD Radeon AI PRO R9700.
  • Framework Desktop: система на базе процессора AMD Ryzen AI Max+ 395 Strix Halo.

Результаты на AMD Ryzen AI Max+ 395 Strix Halo

На платформе Strix Halo, объединяющей CPU и GPU в единый чип, разрыв между бэкендами варьируется в зависимости от модели. В большинстве сценариев Vulkan демонстрирует преимущество в скорости генерации токенов.

Модель ROCm (токенов/сек) Vulkan (токенов/сек) Разница
Llama-3.1-8B-Instruct 45.2 48.1 +6.4%
Qwen2.5-7B-Instruct 42.8 46.5 +8.6%
Mistral-7B-Instruct 44.1 45.9 +4.1%

Результаты на AMD Radeon AI PRO R9700

На профессиональной рабочей станции с Radeon AI PRO R9700 ситуация еще более однозначна. Vulkan-бэкенд стабильно опережает ROCm, что может быть связано с оптимизациями драйверов RADV для конкретных рабочих нагрузок LLM.

Модель ROCm (токенов/сек) Vulkan (токенов/сек) Разница
Llama-3.1-70B-Instruct 12.4 13.8 +11.3%
Phi-3.5-mini-instruct 68.5 74.2 +8.3%

Почему это важно

Для энтузиастов и разработчиков, запускающих локальные AI-серверы через Lemonade, выбор бэкенда критичен. Если ROCm традиционно считался «родным» и оптимальным решением для AMD, то эти данные показывают, что Vulkan (RADV) может быть более производительным выбором для многих моделей. Это требует пересмотра рекомендаций по настройке окружения для максимального быстродействия.

Источник: Phoronix ↗