Инструменты2 сентября 2026 г., 13:19 МСК🤖 Auto

Intel LLM-Scaler v0.26: Оптимизация Arc для DeepSeek-V4 и Qwen

Intel выпустила бета-версию LLM-Scaler-vLLM 0.26.0-b1, адаптированную под vLLM 0.26. Обновление добавляет поддержку DeepSeek-V4, ускоряет генерацию Qwen и улучшает работу с FP8 кэшем на GPU Intel Arc.

Баннер новости 6582

Новая база: vLLM 0.26 и DeepSeek-V4

Компания Intel обновила свой проект LLM-Scaler-vLLM, выпустив версию 0.26.0-b1. Ключевое изменение — ребейз на актуальную версию фреймворка vLLM 0.26. Это критически важно для энтузиастов и разработчиков, использующих графические процессоры Intel Arc (включая линейку Pro), так как обеспечивает нативную поддержку новых архитектурных решений.

В рамках обновления upstream-версии 0.26 в LLM-Scaler добавлена поддержка ядра DeepSeek-V4. Это позволяет эффективно запускать и обслуживать модели семейства DeepSeek на оборудовании Intel, что расширяет спектр доступных LLM для локального развёртывания.

Производительность: Qwen, FP8 и JIT

Оптимизации затронули не только совместимость, но и метрики скорости. Intel отмечает улучшение показателя Time-to-First-Token (TTFT) для моделей семейства Qwen. Это напрямую влияет на отзывчивость чат-ботов и интерактивных приложений.

Также улучшена производительность кэша ключей и значений (KV cache) в формате FP8. Использование 8-битной плавающей точки снижает потребление памяти и пропускной способности, что особенно важно для работы с большими моделями на видеокартах с ограниченным объемом VRAM.

Технические детали и инфраструктура

Обновление включает внедрение инфраструктуры JIT warm-up (Just-In-Time компиляция с предварительной инициализацией), что помогает снизить задержки при первом запуске моделей. Кроме того, улучшена логика KV offloading (выгрузки кэша), позволяющая эффективнее использовать системную память при нехватке видеопамяти.

Сравнение ключевых улучшений

Компонент/Модель Тип улучшения Описание эффекта
vLLM 0.26 База Полная совместимость с последней версией фреймворка
DeepSeek-V4 Поддержка Добавлено ядро для запуска моделей DeepSeek
Qwen Скорость Улучшен Time-to-First-Token (TTFT)
FP8 KV Cache Эффективность Оптимизация работы с 8-битным кэшем
JIT Warm-up Инфраструктура Снижение задержек при инициализации

Как установить

Решение поставляется в виде Docker-образа, что упрощает процесс развёртывания. Пользователям не требуется вручную собирать зависимости или настраивать сложные окружения. Актуальные сборки и исходный код доступны на GitHub проекта Intel LLM-Scaler.

Источник: Phoronix ↗