Новая база: vLLM 0.26 и DeepSeek-V4
Компания Intel обновила свой проект LLM-Scaler-vLLM, выпустив версию 0.26.0-b1. Ключевое изменение — ребейз на актуальную версию фреймворка vLLM 0.26. Это критически важно для энтузиастов и разработчиков, использующих графические процессоры Intel Arc (включая линейку Pro), так как обеспечивает нативную поддержку новых архитектурных решений.
В рамках обновления upstream-версии 0.26 в LLM-Scaler добавлена поддержка ядра DeepSeek-V4. Это позволяет эффективно запускать и обслуживать модели семейства DeepSeek на оборудовании Intel, что расширяет спектр доступных LLM для локального развёртывания.
Производительность: Qwen, FP8 и JIT
Оптимизации затронули не только совместимость, но и метрики скорости. Intel отмечает улучшение показателя Time-to-First-Token (TTFT) для моделей семейства Qwen. Это напрямую влияет на отзывчивость чат-ботов и интерактивных приложений.
Также улучшена производительность кэша ключей и значений (KV cache) в формате FP8. Использование 8-битной плавающей точки снижает потребление памяти и пропускной способности, что особенно важно для работы с большими моделями на видеокартах с ограниченным объемом VRAM.
Технические детали и инфраструктура
Обновление включает внедрение инфраструктуры JIT warm-up (Just-In-Time компиляция с предварительной инициализацией), что помогает снизить задержки при первом запуске моделей. Кроме того, улучшена логика KV offloading (выгрузки кэша), позволяющая эффективнее использовать системную память при нехватке видеопамяти.
Сравнение ключевых улучшений
| Компонент/Модель | Тип улучшения | Описание эффекта |
|---|---|---|
| vLLM 0.26 | База | Полная совместимость с последней версией фреймворка |
| DeepSeek-V4 | Поддержка | Добавлено ядро для запуска моделей DeepSeek |
| Qwen | Скорость | Улучшен Time-to-First-Token (TTFT) |
| FP8 KV Cache | Эффективность | Оптимизация работы с 8-битным кэшем |
| JIT Warm-up | Инфраструктура | Снижение задержек при инициализации |
Как установить
Решение поставляется в виде Docker-образа, что упрощает процесс развёртывания. Пользователям не требуется вручную собирать зависимости или настраивать сложные окружения. Актуальные сборки и исходный код доступны на GitHub проекта Intel LLM-Scaler.
Источник: Phoronix ↗
