Запуск больших языковых моделей (LLM) локально — это не просто хобби, а вопрос контроля над данными, конфиденциальности и экономии. Но у этого пути есть один главный ограничитель: видеопамять (VRAM). Чем больше VRAM, тем больше модель вы можете запустить, тем длиннее контекст вы можете обработать и тем больше пользователей могут работать с системой одновременно. Традиционно путь к большим объемам памяти вел через дорогие решения от NVIDIA, такие как RTX Pro 4000, которые стоят около 2500 долларов и предлагают 24 ГБ памяти. Но что, если есть способ получить тот же объем, но дешевле? Или даже в четыре раза больше?
В этом разборе мы погружаемся в мир альтернативных решений. Мы тестируем новые GPU от Intel серии B (B60 и B70), которые предлагают 24 ГБ и 32 ГБ VRAM соответственно по ценам, которые кажутся нереальными по сравнению с NVIDIA. Но главное — мы сравниваем три конфигурации: одну карту Intel B70, две отдельные карты B60 и одну специфическую плату MaxSun, на которой физически размещены два GPU B60 на одном слоте PCIe. Это не просто сравнение «железа», это тест на то, как программное обеспечение и архитектура материнской платы влияют на реальную производительность в задачах генерации текста и видео.
01Контекст: Почему VRAM — это новый бензин для ИИ
Прежде чем переходить к цифрам, важно понять физику процесса. Локальный запуск LLM требует, чтобы веса модели (параметры) находились в видеопамяти. Если модель не помещается в VRAM, система начинает использовать оперативную память (RAM) или даже диск, что приводит к катастрофическому падению скорости генерации токенов. Например, модель Qwen 2.5 32B в квантовании INT4 занимает около 18-20 ГБ. Один GPU с 24 ГБ VRAM (как у B60) может запустить её, но с минимальным запасом. Если вы захотите увеличить контекстное окно или добавить больше пользователей, вам понадобится больше памяти.
Здесь вступает в игру Intel. Их новые карты Arc B60 (24 ГБ за ~650$) и B70 (32 ГБ за ~1000$) предлагают беспрецедентное соотношение «VRAM за доллар». Но есть нюанс: «дешевая VRAM» и «полезная VRAM» — это разные вещи. Полезность зависит от пропускной способности памяти, поддержки форматов (FP8, INT4) и, что критично, от программного стека. NVIDIA выигрывает за счет CUDA и оптимизированных библиотек. Intel активно догоняет, но отставание в софте все еще ощущается.

02Участники теста: Железо и цены
В нашем эксперименте участвуют следующие устройства:

- Intel Arc B60: 24 ГБ VRAM, цена ~650$. Базовая карта для старта.
- Intel Arc B70: 32 ГБ VRAM, цена ~1000$. Более мощный вариант с поддержкой FP8.
- MaxSun Dual B60: Уникальная плата, содержащая два GPU B60 на одном слоте PCIe. Физически это одна карта, но логически два независимых устройства. Цена выше, чем у двух отдельных B60, но ниже, чем у NVIDIA.
- Сравнение с NVIDIA: RTX Pro 5000 (48 ГБ, ~6000$) и Pro 6000 (96 ГБ, ~17500$) используются как эталон «дорогого» пути.
Тестовая платформа построена на базе Intel Xeon и материнской платы ASUS Pro, что важно для поддержки функций разделения слотов PCIe (bifurcation), о которых мы поговорим ниже. Корпус Fractal позволяет разместить необходимое количество карт.
03Тест 1: Генерация текста (LLM) — Скорость токенов в секунду
Самый важный метрик для чат-ботов — это скорость генерации токенов (tokens per second, t/s). Чем выше число, тем быстрее отвечает ИИ. Мы тестировали три модели разного размера.

Малая модель: Qwen 3 4B (FP8)
Для начала мы взяли легковесную модель Qwen 3 с 4 миллиардами параметров в формате FP8. Intel B70 показала результат в 92 токена/с. Это впечатляющая скорость. Для сравнения, конфигурация из двух карт B60, работающих вместе в режиме Tensor Parallelism (разделение вычислений между GPU), показала результат ниже, чем одна B70. Одна карта B60 также отстала от B70. Это логично: B70 имеет более высокую вычислительную мощность (compute) и пропускную способность памяти, чем B60.
Средняя модель: Qwen 3.5 27B (INT4)
Здесь ситуация меняется. Модель Qwen 3.5 с 27 миллиардами параметров в квантовании INT4 занимает почти 30 ГБ. Одна карта B60 (24 ГБ) физически не может запустить эту модель — памяти не хватает. B70 (32 ГБ) запускает её, но со скоростью 28.3 токена/с. Однако, конфигурация из двух карт B60 (итого 48 ГБ VRAM) справляется лучше, выдавая более высокий результат (точное значение в транскрипте не указано, но сказано, что «two b60s actually beat it»). Это демонстрирует преимущество объема памяти: когда модель помещается в VRAM с запасом, система работает стабильнее, а распределение нагрузки между двумя GPU может быть эффективнее, чем на одном более медленном GPU.

Сложная модель: MoE 30B (INT4)
Мы также протестировали модель типа Mixture of Experts (MoE) на 30 миллиардов параметров. Здесь B70 выдала 45 токенов/с, а одна B60 — 44.5 токена/с. Разница минимальна. Но когда мы подключили две B60, скорость упала. Почему? Из-за задержек (latency) при коммуникации между GPU. В режиме Tensor Parallelism карты должны обмениваться данными через шину PCIe. Если модель не оптимизирована для такого разделения или если архитектура шины не идеальна, накладные расходы на передачу данных могут нивелировать прирост от двух GPU. Это ключевой момент: больше GPU ≠ всегда быстрее. Зависит от модели и софта.

04Тест 2: Генерация видео (LTX-Video)
Задачи генерации видео (Text-to-Video) часто являются «compute-bound» (ограниченными вычислительной мощностью), а не «memory-bound» (ограниченными памятью). Мы запустили модель LTX-2 в ComfyUI с запросом «Arnold Schwarzenegger saying I'll be back».
Результаты:

- Intel B70: 167 секунд на генерацию видео.
- Одна B60 (или один GPU в MaxSun): ~226 секунд.
- Две B60 (MaxSun): ~224-226 секунд.
Здесь B70 явно выигрывает благодаря большей вычислительной мощности. Но интересно, что две B60 (MaxSun) и одна B60 показали практически одинаковое время. Это потому, что модель LTX-2 в данном тесте была привязана к одному GPU. Она не использовала оба GPU MaxSun параллельно для ускорения. Таким образом, весь объем VRAM (48 ГБ) в MaxSun не дал прироста в скорости генерации, но позволил бы запустить более тяжелые модели, если бы они требовали больше памяти. Для видео, где важна скорость рендеринга, B70 предпочтительнее. Для задач, где важна вместимость контекста или количество одновременных пользователей, MaxSun интереснее.
05Тест 3: Энергопотребление
При одинаковой нагрузке (генерация текста) мы измерили потребление энергии. MaxSun Dual B60 потребляет около 129 Вт, в то время как две отдельные карты B60 потребляют около 134 Вт. Разница небольшая, но стабильная. Одна карта с двумя GPU на плате немного эффективнее в плане тепловыделения и энергопотребления, так как исключает часть потерь на интерфейсах между отдельными картами. Это может быть важно для серверных стоек, где охлаждение и электричество стоят денег.

06Сложность установки: Проблема Bifurcation
Самый большой подвох при использовании MaxSun Dual B60 — это настройка материнской платы. Карта не имеет собственного переключателя (switch) между двумя GPU. Они должны общаться через процессор и шину PCIe. Для этого материнская плата должна поддерживать PCIe Bifurcation — разделение одного физического слота PCIe x16 на два слота x8 (или x4/x4, в зависимости от архитектуры).

В нашем тесте карта изначально не определялась системой. Операционная система видела пустой слот. Решение нашлось только в BIOS: необходимо вручную настроить разделение слота. На серверных платах (как ASUS Pro в тесте) это часто делается через удаленное управление (IPMI/BMC), что удобно для серверов, но требует технических знаний. На обычных потребительских материнских платах поддержка bifurcation может быть ограничена или отсутствовать. Также важно учитывать IOMMU-группы: если GPU попадают в разные группы, они могут не получить полную пропускную способность. Intel Xeon Sixth Gen, как правило, решает эти проблемы лучше, чем потребительские Core-процессоры.
07Масштабируемость: От 48 ГБ к 192 ГБ
Главный аргумент в пользу MaxSun Dual B60 — это плотность установки. Если у вас есть сервер с 7 слотами PCIe, вы можете установить:

- 4 карты B60: 96 ГБ VRAM (4 x 24 ГБ).
- 4 карты MaxSun Dual B60: 192 ГБ VRAM (4 x 48 ГБ).
Это колоссальная разница. 192 ГБ VRAM за ~7000 долларов (4 x ~1750$) против ~24 000 долларов за 192 ГБ VRAM на NVIDIA RTX Pro 5000 (4 x 48 ГБ). Конечно, NVIDIA предлагает более быструю память GDDR7 и оптимизированный стек CUDA. Но для многих задач, где важна именно вместимость памяти (например, запуск огромных моделей с длинным контекстом, обучение LoRA, обработка больших датасетов), Intel-решение становится единственным доступным бюджетным вариантом.
08Программный стек: LLM Scalar и vLLM
Производительность Intel сильно зависит от софта. В тесте использовался LLM Scalar — форк популярного движка vLLM. На момент тестирования он отставал от актуальной версии vLLM примерно на месяц. Поддерживаемые модели перечислены в GitHub-репозитории разработчиков. Это значит, что самые свежие SOTA-модели могут не работать «из коробки» или требовать ручной настройки. Intel активно работает над этим, и прогресс есть (например, поддержка Qwen 3.5 появилась недавно), но до уровня зрелости NVIDIA CUDA, где всё работает автоматически, еще далеко. Для энтузиастов это вызов, для бизнеса — потенциальный риск совместимости.

09Выводы: кому что подойдёт
Итак, подведем итоги. Выбор между одной картой, двумя картами и гибридной платой зависит от ваших задач и ограничений.

- Intel Arc B70 (32 ГБ): Идеальный выбор для тех, кто хочет простоты и скорости. Одна карта, один слот, никаких сложных настроек BIOS. Отлично подходит для запуска моделей до 30-34B параметров. Лучший выбор для генерации видео и быстрой генерации текста. Подходит для любой современной материнской платы.
- Две карты Intel Arc B60: Хороший вариант, если у вас есть два свободных слота PCIe и вы хотите получить 48 ГБ VRAM. Требует настройки Tensor Parallelism. Может быть медленнее одной B70 в некоторых сценариях из-за задержек коммуникации. Но дает больше памяти для контекста.
- MaxSun Dual B60 (48 ГБ в одном слоте): Специфическое решение для серверных стоек с ограниченным количеством слотов. Позволяет получить 192 ГБ VRAM в 4 слота. Требует материнской платы с поддержкой PCIe Bifurcation и настройки BIOS. Не дает прироста скорости в compute-bound задачах (видео), но дает огромный прирост в памяти. Идеально для плотной упаковки VRAM. Цена выше, чем у двух B60, но оправдана экономией места и энергии.
Для российского рынка эти карты пока недоступны официально, но их можно заказать через посредников. Цены, указанные в видео, являются базовыми ориентирами. Учитывая курс валют и логистику, стоимость может быть выше. Однако, даже с наценкой, соотношение «VRAM за доллар» остается привлекательным по сравнению с NVIDIA. Если вы готовы возиться с драйверами, BIOS и настройкой PCIe-слотов, Intel Arc B-серии открывает двери в мир локального ИИ с большими объемами памяти, которые раньше были доступны только корпоративным клиентам с огромными бюджетами.
Мы ждем от Intel улучшения программного стека и появления Dual B70 (64 ГБ на одной плате), что позволит достичь 256 ГБ VRAM в одной машине. Но пока MaxSun Dual B60 — это уникальный продукт, заполняющий нишу между дешевыми потребительскими картами и дорогими профессиональными решениями.
Источник: видео-разбор (YouTube) ↗
