Представьте ситуацию, которая несколько месяцев назад казалась фантастикой: мини-ПК стоимостью 1500 долларов запускает модель с 120 миллиардами параметров. Та же самая модель, которую пытается запустить NVIDIA DGX Spark, стоит 4700 долларов и работает лишь на 13% медленнее. Но есть один критический нюанс, о котором молчат многие обозреватели: коробка NVIDIA физически не может загрузить эту модель. Это не баг бенчмарка, это «стена VRAM» — число, которое полностью меняет правила игры при покупке локальной ИИ-машине в 2026 году.
Два года назад запуск серьезных локальных больших языковых моделей (LLM) означал выбор из трех дорогих путей: покупка Mac Studio за 5000 долларов, вложение 4000 долларов в рабочую станцию NVIDIA или оплата облачных счетов, которые незаметно съедали бюджет. 30 долларов в месяц за API Anthropic кажутся приемлемыми, пока ваш пайплайн агентов не работает всю ночь, после чего вы просыпаетесь со счетом в 400 долларов. Именно этот контекст делает появление AMD Ryzen AI Max Plus (кодовое название Strix Halo) не просто обновлением железа, а сменой парадигмы.
В этой статье мы разберем, почему унифицированная память AMD стала реальным финансовым аргументом, как обстоят дела с производительностью ROCm против CUDA, почему NPU пока не играет роли для LLM, и кому действительно стоит покупать эти устройства прямо сейчас. Мы также рассмотрим грядущие релизы, такие как Gorgon Halo, и альтернативы от Apple и Qualcomm.
011. Экономический сдвиг: Память как новый лимит
Ключевой фактор, определяющий стоимость локального ИИ, — это цена за гигабайт памяти. В индустрии долгое время доминировала логика NVIDIA, где видеопамять (VRAM) была отдельным, дорогим компонентом. Однако дефицит памяти HBM (High Bandwidth Memory), который, по словам генерального директора NVIDIA Дженсена Хуана, продлится несколько лет, привел к резкому росту цен. В первом квартале 2026 года контрактные цены на DRAM выросли на 90-95% по сравнению с предыдущим кварталом. Это привело к тому, что NVIDIA DGX Spark, изначально заявленный за 3999 долларов, к февралю 2026 года подорожал до 4699 долларов — скачок почти на 700 долларов за квартал только из-за удорожания компонентов.
AMD предлагает альтернативу через унифицированную память. Чип Strix Halo поставляется с объемом памяти до 128 ГБ LPDDR5X. Пользователь может выделить от 96 до 112 ГБ этой памяти под нужды видеопамяти (VRAM). Это позволяет загрузить модели, которые физически не помещаются в стандартные дискретные GPU. Например, RTX 5090, лучшая потребительская видеокарта NVIDIA, имеет всего 32 ГБ VRAM. Модель на 120 миллиардов параметров требует минимум 70 ГБ памяти даже при сильной квантизации. RTX 5080 с 16 ГБ VRAM вообще не может загрузить такую модель. Таким образом, когда AMD заявляет, что их чип в 3,05 раза быстрее RTX 5080 на модели DeepSeq R1, это победа не вычислительной мощности, а доступности памяти. AMD сравнивает себя с конкурентом, который даже не участвует в гонке за этот конкретный workload.

Ценообразование становится очевидным. Мини-ПК на Strix Halo стоит от 1500 долларов. Это дает стоимость около 25,77 долларов за гигабайт унифицированной памяти. Для сравнения, Apple Mac Studio с M3 Ultra Max (96 ГБ) стоит от 4999 долларов, что составляет около 41,66 долларов за гигабайт. AMD выигрывает в цене за емкость, что делает локальный ИИ доступным для энтузиастов и малого бизнеса.
022. Производительность: Токены в секунду и реальная скорость
Загрузка модели — это только половина дела. Как она работает? В тестах на модели GPT-OSS 120B (120 миллиардов параметров) Strix Halo демонстрирует скорость около 34 токенов в секунду. NVIDIA DGX Spark, используя чип GB10, показывает около 38,5 токенов в секунду. Разница составляет 13% в пользу NVIDIA. Для большинства локальных задач, таких как общение с агентами или генерация контента, 34 токена в секунду — это скорость, превышающая скорость чтения человеком. Разница в 13% становится критичной только если вы строите высоконагруженный сервер инференса, где каждый миллисекундный отклик важен.

Однако есть нюанс, который часто упускают. Бэкенд Vulkan на Strix Halo иногда превосходит CUDA на DGX Spark при генерации токенов. Это неожиданный результат, но цифры говорят сами за себя. Это указывает на то, что оптимизация драйверов AMD для конкретных workload'ов может быть эффективнее, чем общая экосистема NVIDIA, по крайней мере в некоторых сценариях генерации.
Но NVIDIA все еще имеет огромное преимущество в скорости префилла (prefill speed). Префилл — это время, которое система тратит на обработку вашего входного запроса перед началом генерации токенов. Это критически важно для задач с длинным контекстом, например, когда вы загружаете 50-страничный документ для анализа. На этом тесте DGX Spark показывает около 1723 токенов в секунду, в то время как Strix Halo выдает лишь 340. Разница в 5 раз в пользу NVIDIA. Если ваш рабочий процесс требует постоянного анализа больших объемов текста, преимущество DGX Spark реально и ощутимо.

033. Железо: Strix Halo и будущие чипы
На рынке сегодня доступны три основные модели мини-ПК на базе Strix Halo. Самая доступная — GMK-Tech Evo X2, стартующая с 1499 долларов. Это впечатляющая цена за такую мощность. Более премиальный вариант — Framework Desktop за 2348 долларов. Он ценится сообществом за модульность и ремонтопригодность. Третий вариант — Corsair AI Workstation 300 за 2699 долларов. Это более отполированное решение с лучшей системой охлаждения, ориентированное на про-сьюмеров, которым нужен «ощущение рабочей станции».
Но это только начало. AMD уже анонсировала следующий чип — Ryzen AI Max Plus Pro 495, кодовое название Gorgon Halo. Он запланирован на третий квартал 2026 года. Этот чип будет поддерживать до 192 ГБ унифицированной памяти, из которых 160 ГБ будут доступны для ИИ-задач. Этого объема хватит для запуска моделей с 300 миллиардами параметров прямо на вашем столе. В этой категории емкость становится новым вычислением. Если вам нужно запускать модели уровня GPT-4 или Claude 3 Opus локально, Gorgon Halo станет первым доступным решением.

Также в утечках фигурирует чип Medusa Halo, который, по слухам, будет использовать ядра Zen 6, графику RDNA 5 и память LPDDR6. Прогнозируемая пропускная способность составит от 460 до 691 ГБ/с, что позволит сократить разрыв с Apple Silicon. Однако эти данные пока не подтверждены официально, и их стоит воспринимать с осторожностью. Также упоминается чип на базе Zen 7, но у него только один источник информации, поэтому его надежность низка.
044. Программная экосистема: ROCm против CUDA
Здесь кроется главный подвох. AMD продвигает свой стек GPU-вычислений ROCm, аналог NVIDIA CUDA. На архитектуре Strix Halo (GX1151) ROCm находится в статусе «превью», а не бета. Это означает, что стабильность и поддержка не гарантированы. Критически важно: поддержка Windows отсутствует. ROCm на Strix Halo работает только на Linux. Если вы пользователь Windows и хотите серьезные GPU-ускоренные задачи, вы пока не готовы к AMD.

Comfy UI, популярный инструмент для генерации изображений, reportedly (сообщается) падает на определенных рабочих процессах. Продвинутые пользователи обходят эту проблему, используя Vulkan, но это не то же самое, что зрелый, оптимизированный пайплайн CUDA. У CUDA 15 лет развития экосистемы. ROCm догоняет быстро, но он все еще «малыш» рядом с «подростком». Игнорирование этого факта может привести к потере времени и нервов.
Тем не менее, AMD работает над улучшением ситуации. Был анонсирован SDK Lemonade (не HelloBox, как ошибочно транскрибировала система), который призван упростить развертывание и управление локальными моделями на оборудовании Strix Halo. Это шаг в правильном направлении для разработчиков open-source.
055. Миф о пропускной способности памяти
AMD заявляет пропускную способность памяти 256 ГБ/с для Strix Halo. Это теоретический максимум, достижимый в идеальных условиях. Однако независимые тесты показывают реальную скорость чтения около 122 ГБ/с. Это менее половины от заявленного числа и ближе к тому, что модели видят на практике. Для сравнения, Apple M3 Ultra обеспечивает около 819 ГБ/с. Apple Silicon абсолютно разбивает AMD по чистой пропускной способности.

Пропускная способность определяет, как быстро токены текут, когда вы ограничены памятью, а вы почти всегда ограничены ею при таких размерах моделей. Apple выигрывает по пропускной способности более чем в 6 раз. AMD выигрывает по цене за гигабайт, но Apple выигрывает по скорости потока данных. Это компромисс: вы платите меньше за объем, но получаете меньшую скорость передачи данных.
066. NPU: Маркетинг или реальность?
AMD продвигает NPU XDNA2 внутри Strix Halo с впечатляющими показателями в TOPS (триллионы операций в секунду). Но вот правда: Ollama, llama.cpp и LM Studio не используют NPU для инференса LLM. Они привязываются к iGPU и упираются в пропускную способность памяти. NPU сейчас не делает ничего для ваших локальных моделей. Это маркетинговое число, а не практическая функция для данного use-case. Возможно, в будущем NPU станет важен для специфических ускоренных задач, но сегодня он не влияет на скорость работы LLM.

077. Агенты и будущее локального ИИ
Джек Хуан, старший вице-президент AMD по вычислениям и графике, выдвинул тезис на Dev Day в Сан-Франциско: главный пользователь вашего компьютера — больше не вы. Это ИИ-агент. Вы ставите задачи перед сном, агенты работают ночью, и вы просыпаетесь с резюме. Узкое место здесь не в вычислительной мощности GPU, а в том, сколько параллельных агентов вы можете запустить одновременно, не лишая их памяти.
AMD продемонстрировала это на примере Ryzen Claw. Модель Qwen 3.5-35B работала со скоростью около 45 токенов в секунду, при этом одновременно запускались шесть параллельных агентов на 128 ГБ унифицированной памяти. Шесть агентов, одна машина, отсутствие конкуренции за память. Это реальный killer-use-case для унифицированной памяти. Запуск шести агентов на дискретной GPU-системе либо ограничит вас маленькими моделями из-за нехватки VRAM, либо заставит постоянно использовать системную память, что убьет производительность. Унифицированная память меняет эту математику.

Это также открывает возможности для таких платформ, как AI Master, которые позволяют запускать сложные пайплайны: исследование, черновик сценария, генерация изображений, планирование контента. Все это может работать ночью, используя локальные ресурсы, без облачных счетов. Сообщество AI Master уже насчитывает более 12 000 создателей, и платформа предлагает интеграцию всех топовых LLM, генерацию изображений и видео, а также монетизацию персонажей.
088. Конкуренты: Apple, NVIDIA и Qualcomm
Apple M3 Ultra Max остается королем пропускной способности памяти (819 ГБ/с). Если пропускная способность — ваш главный узкий горлышко, Apple все еще вне конкуренции. Но цена в 5000+ долларов делает ее недоступной для многих.

NVIDIA DGX Spark выигрывает в префилле и зрелости ПО (CUDA). Но цена в 4700 долларов и невозможность запустить большие модели из-за нехватки VRAM делают его менее привлекательным для индивидуальных разработчиков, которым не критичен префилл.
Qualcomm Snapdragon X2 Elite также заявляет 128 ГБ памяти, но пропускная способность составляет всего 228 ГБ/с, что ниже теоретического максимума Strix Halo и близко к реальным показателям AMD. Программная экосистема Qualcomm для локального ИИ ИИ инференса пока менее зрелая, чем у AMD. Скорее всего, он уступит Strix Halo в пропускной способности токенов.

Также ожидается ответ NVIDIA в виде RTX Spark — преемника DGX Spark на базе ARM и GPU Blackwell. Слухи говорят о цене от 1799 до 2899 долларов и релизе осенью 2026 года. Но пока это только слухи.
09Выводы: кому что подойдёт
Итак, подведем итоги. Обе стороны правы одновременно. AMD выигрывает в цене за емкость и возможности запуска больших моделей. NVIDIA выигрывает в скорости префилла и зрелости ПО. Вот как принять решение:

- Покупайте AMD Strix Halo (GMK-Tech Evo X2 или Framework Desktop), если: вы запускаете домашнюю лабораторию, строите пайплайны агентов или работаете с моделями 70B-120B локально. Математика работает. Вы получаете доступ к большим моделям по цене 1500-2300 долларов. Это лучший выбор для энтузиастов и создателей контента, которым важна емкость.
- Не покупайте Strix Halo, если: вы полностью зависите от CUDA. Если ваши инструменты, кастомные ядра и рабочие процессы команды требуют NVIDIA, не покупайте Strix Halo как основную рабочую станцию. ROCm еще недостаточно зрел. Подождите 6 месяцев.
- Рассмотрите Apple M3 Ultra, если: вам нужна максимальная пропускная способность памяти, и вы готовы платить премию. Это самый целостный пакет для высокопроизводительного инференса, особенно если вы уже в экосистеме Apple.
- Подождите, если: вы не спешите. Gorgon Halo с 192 ГБ памяти выйдет в Q3 2026, а ответ NVIDIA (RTX Spark) ожидается осенью 2026 года. Если вы можете подождать 6 месяцев, рынок станет интереснее.
Заголовок «AMD убила подписки на ИИ» не преувеличение. Мини-ПК за 1500 долларов запускает модели, которые NVIDIA DGX Spark за 4700 долларов не может загрузить. Caveats (оговорки) реальны: ПО незрелое, пропускная способность ниже заявленной, NVIDIA выигрывает в префилле. Но для многих сценариев, особенно связанных с агентами и большими моделями, AMD Strix Halo — это не просто альтернатива, а лучшее решение по соотношению цена/возможности. Ваша задача — понять, какой столбец важнее для вашего конкретного workload'а.
Если вы хотите запускать эти workload'и внутри proper agent-пайплайна, не строя все с нуля, платформа AI Master, которую использует команда автора, предлагает готовое решение. Один интерфейс для всех топовых LLM, генерация изображений и видео, монетизация персонажей. Сообщество из 12 000 пользователей, 7-дневная гарантия возврата. Переходите на aimaster.me, чтобы начать работу с агентами уже сегодня.
Источник: видео-разбор (YouTube) ↗
