Новый бэкенд HRX: что это и зачем
Вышла версия локального AI-сервера Lemonade 11.9, поддерживающая Linux, Windows и macOS. Главная инновация — экспериментальная интеграция AMD ROCm HRX (Hyperloom Runtime eXtension) через Llama.cpp. HRX — это легковесная альтернатива традиционному HIP/Vulkan стеку, часть инициативы AMD Loom/Hyperloom, направленная на оптимизацию клиентских систем (PC, ноутбуки) вместо дата-центров. Цель — упростить разработку и повысить производительность на GPU, NPU и CPU AMD.
Технические детали и совместимость
На данный момент HRX-бэкенд работает в экспериментальном режиме для следующих архитектур AMD:
- Radeon RX 7900 series (RDNA3, GFX1100)
- Strix Halo APUs (RDNA3.5, GFX1151)
Технология использует новый промежуточный язык (IR) Loom, который генерирует оптимизированный AMDGPU-код быстрее, чем классический LLVM IR. Это позволяет быстрее доставлять код в финальную сборку, снижая накладные расходы на запуск моделей.
Ожидаемый прирост производительности
Инженеры AMD, включая Stella Laurenzo, заявляют о существенном улучшении метрик скорости по сравнению со старыми бэкендами (Vulkan и HIP). Ниже приведены заявленные улучшения для модели Qwen3-30B-A3B-Instruct-2507-GGUF (Q4_K_M):
| Метрика | Улучшение (HRX vs Vulkan/HIP) | Примечание |
|---|---|---|
| Скорость префилла (Prefill) | +30% ~ +50% токенов/сек | Значительный ускоритель начальной обработки запроса |
| Скорость декодирования (Decode) | +10% токенов/сек | nПаритет или небольшой прирост для задач без MTP |
| Сложность разработки | Снижена | Более простой стек для интеграции новых моделей |
Дополнительные улучшения Lemonade 11.9
Помимо HRX, обновление включает поддержку Qwen3-Next в стандартном бэкенде Llama.cpp. Проект продолжает курс на «100% бесплатное и приватное» использование ИИ на локальном оборудовании, делая ставку на нативные решения AMD для клиентского сегмента. Поддержка расширится на другие GPU по мере стабилизации стека HRX.
Источник: Phoronix ↗
