Главная/Блог/Обзор/Linux против Windows для локального ИИ:…
Обзор11 мин чтения · 3 июля 2026 г.

Linux против Windows для локального ИИ: Тест AMD Ryzen AI 9 HX470

Полный разбор производительности локальных LLM на AMD Ryzen AI 9 HX470 (Geekom A9 Max) в Windows, WSL и Linux. Выясняем, почему NPU не работает, как память убивает скорость и какая ОС реально быстрее.

Linux против Windows для локального ИИ: Тест AMD Ryzen AI 9 HX470

Локальный запуск больших языковых моделей (LLM) на потребительском оборудовании перестал быть прерогативой энтузиастов с серверными видеокартами. Современные APU от AMD, такие как серия Strix Point, обещают революцию в области энергоэффективного ИИ, предлагая мощные NPU (нейронные процессоры) и интегрированную графику. Однако на практике выбор операционной системы может стать решающим фактором, который либо раскрывает потенциал железа, либо превращает его в «кирпич».

В этом детальном разборе мы берем актуальный мини-ПК Geekom A9 Max с процессором AMD Ryzen AI 9 HX470 и проводим исчерпывающее тестирование трех сценариев: нативная Windows, подсистема WSL (Windows Subsystem for Linux) и чистый Linux (bare metal). Мы используем одни и те же модели, одни и те же промпты и одни и те же бэкенды (Llama.cpp, Ollama, Lemonade), чтобы изолировать влияние ОС. Результаты могут вас удивить: в некоторых задачах Linux оказывается быстрее Windows в три раза, а в других разница минимальна. Но есть один критический нюанс, который ломает все цифры — конфигурация оперативной памяти.

01Железо: Geekom A9 Max и AMD Ryzen AI 9 HX470

Для тестов используется мини-ПК Geekom A9 Max. Это устройство построено на базе APU AMD Ryzen AI 9 HX470, который относится к семейству Strix Point. Это не просто обновленная версия прошлого поколения, а значительный скачок в архитектуре. Ключевые характеристики процессора:

  • Ядра CPU: 12 ядер Zen 5. Это новейшая архитектура от AMD, обеспечивающая высокую производительность на такт.
  • Графика: Radeon 890M. Это интегрированная видеокарта с 12 вычислительными блоками, которая играет ключевую роль в рендеринге и, что важно для нас, в ускорении инференса LLM через Vulkan.
  • NPU: 50 TOPS (триллионов операций в секунду). Это специализированный блок для задач ИИ, который теоретически должен обеспечивать энергоэффективный запуск моделей.

Конфигурация памяти в тестовом образце: 32 ГБ DDR5-5600. Важно отметить, что изначально в устройстве стояла одна планка памяти. Это критический момент, который мы обсудим позже, так как он напрямую влияет на пропускную способность. Накопитель: 2 ТБ SSD. Порты подключения впечатляют для мини-ПК: два порта USB4, два HDMI 2.1, два порта 2.5 Гбит/с Ethernet, пять портов USB-A, аудиоразъем и слот для карт памяти SD. Такая плотность портов делает устройство удобным хабом, но для ИИ-задач важнее внутренняя архитектура шины памяти.

02Сценарий 1: Нативная Windows и проблема Ollama

Большинство пользователей начинают с Windows, так как это их основная рабочая среда. Первый шаг — запуск Llama.cpp или Ollama. Здесь мы сталкиваемся с первой неожиданностью. По умолчанию, при запуске Ollama в Windows, процесс использует 100% мощности CPU, в то время как GPU (Radeon 890M) остается полностью неактивным (idle).

Даже если явно установить флаг использования Vulkan, Ollama в данной конфигурации «тихо» откатывается обратно к вычислениям на CPU. Это означает, что вы получаете производительность процессора, игнорируя мощную графику. Чтобы заставить GPU работать, пришлось вручную переключиться на запуск Llama.cpp с прямым вызовом бэкенда Vulkan. Только так удалось загрузить GPU на 100%.

Результаты производительности на Windows (через Llama.cpp + Vulkan):

  • Модель 3.8B (Gemma): ~10% прирост скорости по сравнению с CPU-режимом Ollama.
  • Модель 1.5B: разница составляет 14%.
  • Модель 14B: разница падает до 10%.

Эти цифры выглядят скромно. Ожидается, что использование iGPU должно давать более существенный прирост, особенно для больших моделей, где нагрузка на память выше. Однако есть третий путь в Windows — использование сервера AMD Lemonade. Этот инструмент предлагает гибридные рецепты, где NPU используется для этапа pre-fill (подготовка контекста), а GPU — для decode (генерация токенов).

В тестах на decode (генерацию) результаты Lemonade практически совпадают с Llama.cpp Vulkan (разница менее 1%). Однако NPU начинает показывать себя в полной мере только при работе с длинными промптами (long context pre-fill), что мы детально рассмотрим в разделе про Linux. Вывод по Windows: если вы хотите использовать GPU, избегайте стандартного запуска Ollama. Используйте Llama.cpp с Vulkan или AMD Lemonade. Но даже лучший сценарий в Windows не достигает потенциала чипа.

03Сценарий 2: WSL (Windows Subsystem for Linux)

WSL позволяет получить опыт Linux, оставаясь в экосистеме Windows. Это удобно для разработчиков, которым нужна Linux-среда для инструментов, но привычный интерфейс Windows. Установка Ubuntu через WSL — стандартная процедура.

Сразу после установки мы сталкиваемся с проблемой: драйверы. Запуск команды vulkaninfo --summary показывает, что используется программный растеризатор (software rasterizer). Интегрированная графика Radeon 890M «невидима» для системы. В интернете можно встретить миф, что WSL не поддерживает AMD iGPU. Это не совсем так. Проблема в отсутствии специфического файла конфигурации dznicd.json, который отвечает за поддержку драйвера Dozen (Mesa Vulkan driver для WSL).

Стандартный пакет Ubuntu 24.04 (или 26.04, как упоминалось в видео) не содержит этого драйвера «из коробки». Решение требует ручных действий:

  1. Добавить репозиторий с нужными пакетами.
  2. Установить mesa-vulkan-drivers и vulkan-tools.

После установки появляется файл dznicd.json, и система начинает видеть GPU. Теперь WSL видит графический процессор как устройство Microsoft Direct3D12. Запуск Llama.cpp с Vulkan в WSL показывает загрузку GPU на 83% (с небольшой нагрузкой на CPU). Это уже работающая конфигурация.

Сравнивая производительность WSL с нативной Windows, мы видим, что WSL теряет примерно одну шестую часть пропускной способности (около 15-17% потерь). Это плата за виртуализацию. Однако для многих пользователей эта потеря приемлема ради получения полного Linux-тулчейна внутри Windows. Но, как и в случае с нативной Windows, WSL не достигает пиковых значений, которые показывает чистый Linux. И снова причина кроется не в ОС, а в другом факторе.

04Сценарий 3: Bare Metal Linux — Король Pre-fill

Чистый Linux (bare metal) часто считается «золотым стандартом» для ИИ-разработки. В этом сценарии мы запускаем Llama.cpp с различными бэкендами: RADV (открытый драйвер Mesa для AMDGPU) и ROCm (проприетарный стек AMD). Также тестируется Ollama с ROCm.

На этапе decode (генерация токенов) результаты всех бэкендов в Linux практически идентичны. Разница составляет всего несколько процентов. RADV (открытый драйвер) и ROCm (проприетарный) показывают схожие цифры. Это доказывает, что на этапе генерации проблема не в драйверах или ОС, а в другом ограничении.

Однако настоящий прорыв происходит на этапе pre-fill (предварительная обработка длинного промпта). Это критически важный этап для RAG (Retrieval-Augmented Generation), работы с агентами и код-ассистентов, где в контекст загружаются огромные объемы данных (например, весь репозиторий кода). В тестах с длинным промптом Linux с драйвером RADV оказался в три раза быстрее, чем Windows. Это не 3%, а именно 300% производительности. Более того, открытый драйвер RADV превзошел собственный проприетарный драйвер AMD (ROCm) на собственном же оборудовании AMD. Это серьезный аргумент в пользу использования открытых драйверов в Linux для задач с большим контекстом.

05Главный враг производительности: Пропускная способность памяти

Если Linux так быстр, почему же Windows и WSL не показывают таких же результатов на decode? И почему все бэкенды упираются в один потолок? Ответ кроется в физической конфигурации оперативной памяти.

Автор разбора вскрыл Geekom A9 Max и обнаружил, что в слотах установлена только одна планка памяти (1x SO-DIMM). Процессор AMD Ryzen AI 9 HX470 спроектирован так, чтобы работать с памятью в двухканальном режиме (dual-channel), когда данные читаются из двух модулей параллельно. При использовании одной планки система работает в одноканальном режиме (single-channel), что дает примерно половину от теоретической пропускной способности памяти.

Инференс LLM, особенно этап decode, сильно зависит от пропускной способности памяти (memory bandwidth), а не от вычислительной мощности GPU. GPU может быть загружен на 100%, но если данные не успевают поступать из памяти, скорость генерации токенов падает. Это классический bottleneck.

Чтобы подтвердить эту гипотезу, была добавлена вторая планка памяти, доведя объем до 64 ГБ в двухканальном режиме. Результат был ошеломляющим:

  • Windows Vulkan: скорость выросла в 2.13 раза.
  • Linux RADV: скорость выросла более чем в 2 раза.
  • Ollama с ROCm: скорость выросла в 1.86 раза.

Это textbook-пример workload, ограниченного пропускной способностью памяти. Вычислительная мощность GPU никогда не была узким местом. Как только мы устранили ограничение памяти, все ОС и бэкенды показали свои реальные возможности. Цифры на 14B модели достигли 9 токенов/с, на 7B — 17 токенов/с, на 3B — 37 токенов/с. Эти значения соответствуют спецификациям чипа и сравнимы с результатами на других устройствах с аналогичным чипом (например, Beelink SER 10), но с предустановленной двухканальной памятью.

06Роль NPU и AMD Lemonade

Многие покупатели мини-ПК с пометкой «AI» надеются на использование NPU. В Windows с помощью AMD Lemonade можно настроить гибридный режим: NPU обрабатывает pre-fill, а GPU — decode. Однако в тестах на decode NPU не дает прироста по сравнению с чистым GPU. NPU проявляет себя только при работе с очень длинными контекстами, где его энергоэффективность и специализация могут быть полезны. Но в текущих реализациях драйверов и софта (особенно в Windows) основная нагрузка все равно ложится на GPU. В Linux с открытыми драйверами (RADV) производительность pre-fill настолько высока, что необходимость в NPU для этого этапа отпадает.

Важно отметить, что модель Gemma 2 12B, использованная в тестах, является актуальной архитектурой, что подтверждает универсальность выводов. Старые модели (как Qwen 2.5) не являются причиной низких результатов в одноканальном режиме.

07Сравнение с предыдущим поколением: A9 Max с HX370

На рынке также доступен Geekom A9 Max с процессором Ryzen AI 9 HX370 (предыдущее поколение Strix Point). Визуально устройства идентичны. HX370 имеет чуть меньшую производительность NPU и GPU. По личному опыту автора, HX370 — отличная машина для разработки, но для ИИ-задач HX470 быстрее примерно на 9-10%. Однако разница в цене между моделями может быть существенной. Если бюджет ограничен, HX370 может быть более выгодным выбором, особенно если вы готовы самостоятельно докупить память для двухканального режима. Важно при покупке внимательно проверять, какая именно модель чипа установлена, так как названия устройств совпадают.

08Практические рекомендации для РФ и СНГ

Для российских пользователей, рассматривающих покупку подобных устройств, важно учитывать несколько факторов:

  1. Доступность памяти: Покупка второй планки DDR5 SO-DIMM в РФ сейчас доступна и стоит около 3000-4000 рублей (эквивалент ~$30-40). Это критически важно. Без двухканального режима вы теряете половину производительности ИИ-инференса.
  2. Выбор ОС: Если вы разработчик и вам нужен Linux-тулчейн, WSL с установленными драйверами Dozen/Mesa — хороший компромисс. Если вы хотите максимальной производительности для работы с длинными контекстами (RAG, анализ документов) — чистый Linux с драйвером RADV. Для простых чат-ботов и коротких запросов Windows с Llama.cpp + Vulkan вполне достаточна.
  3. Программное обеспечение: Избегайте запуска Ollama в Windows без явного указания Vulkan-бэкенда, так как он часто падает на CPU. Используйте LM Studio или прямые вызовы Llama.cpp. В Linux используйте Llama.cpp с RADV для лучших результатов.

09Выводы: кому что подойдёт

Итоговый вердикт зависит от ваших задач и готовности к настройке:

  • Для максимального pre-fill (RAG, агенты): Чистый Linux (Bare Metal) с драйвером RADV. Он быстрее Windows в 3 раза на длинных контекстах. Открытый драйвер здесь выигрывает у проприетарного ROCm.
  • Для баланса удобства и производительности: WSL с установленными Mesa Vulkan Drivers. Потеря ~15% скорости по сравнению с нативным Linux компенсируется удобством Windows-окружения и доступом к Linux-инструментам.
  • Для простых задач и чатов: Windows с Llama.cpp (Vulkan) или LM Studio. Ollama в Windows работает плохо (на CPU), поэтому его лучше избегать или настраивать вручную. AMD Lemonade — альтернатива, но без явного преимущества на decode.
  • Критическое требование: Независимо от ОС, обязательно используйте двухканальную память (2 планки). Одноканальный режим убивает производительность инференса вдвое. Это не проблема ОС, это проблема железа, которую легко исправить.

AMD Ryzen AI 9 HX470 — мощный чип, но его потенциал раскрыт только при правильной конфигурации памяти и выборе подходящего программного стека. Linux с открытыми драйверами показывает себя как самая быстрая платформа для сложных ИИ-задач, в то время как Windows требует более тщательной настройки для использования GPU. Не забывайте, что производительность ИИ — это не только про токены в секунду, но и про задержку при обработке контекста, где Linux безоговорочно лидирует.

💡
Совет по настройке WSL. Если вы решите использовать WSL, не забудьте добавить репозиторий с драйверами Mesa и установить mesa-vulkan-drivers. Без этого ваша видеокарта AMD будет игнорироваться, и все вычисления пойдут на CPU, что крайне медленно для ИИ.
⚠️
Важно: Одиночная планка памяти. Многие мини-ПК, включая Geekom A9 Max, могут продаваться с одной планкой RAM. Для ИИ-задач это критическая ошибка. Всегда проверяйте конфигурацию и докупайте вторую планку для активации двухканального режима. Это даст двукратный прирост скорости генерации.
📌
Факт о драйверах. В Linux на AMD GPU открытый драйвер RADV (часть Mesa) показал себя лучше, чем проприетарный ROCm, в задачах с длинным контекстом (pre-fill). Это редкий случай, когда open-source решение превосходит официальное решение производителя.
💡
Альтернатива Ollama в Windows. Если вы работаете в Windows, не полагайтесь на Ollama по умолчанию. Используйте Llama.cpp с флагом Vulkan или графический интерфейс LM Studio, который лучше управляет ресурсами GPU в этой ОС.
📌
Сравнение поколений. Geekom A9 Max с HX370 и HX470 визуально идентичны. HX470 быстрее на ~10% в ИИ-задачах. Если разница в цене существенна, HX370 может быть более выгодным выбором, особенно если вы готовы самостоятельно апгрейдить память.
AMD Ryzen AI 9 HX470 Strix Point APU
AMD Ryzen AI 9 HX470 Strix Point APU
Порты Geekom A9 Max: USB4, HDMI, Ethernet
Порты Geekom A9 Max: USB4, HDMI, Ethernet
Загрузка GPU 100% через Llama.cpp Vulkan
Загрузка GPU 100% через Llama.cpp Vulkan
VulkanInfo: программный растеризатор в WSL
VulkanInfo: программный растеризатор в WSL
Результаты после установки двух планок RAM
Результаты после установки двух планок RAM
Сравнение Geekom A9 Max и Beelink SER 10
Сравнение Geekom A9 Max и Beelink SER 10
Планки DDR5 SO-DIMM для апгрейда
Планки DDR5 SO-DIMM для апгрейда

Источник: видео-разбор (YouTube) ↗