Быстрая поддержка Meta Muse Glimmer 30B
Ключевым событием стало обновление LLM-Scaler-vLLM beta 0.21.0-b3, выпущенное 12 августа 2026 года. Проект, выросший из инициативы Project Battlematrix, теперь обеспечивает поддержку модели Muse Glimmer 30B от Meta в день её выхода. Для работы на видеокартах серии Arc Pro B (в частности, B70) используется квантование FP8 и технология DFlash, что критически важно для эффективного использования памяти GPU.
Также в этом релизе улучшена метрика time-to-first-token для моделей Gemma-4-31B и Gemma-4-26B-A4B-it, что напрямую влияет на отзывчивость интерфейсов чат-ботов.
Расширение возможностей генерации видео и изображений
Параллельно вышел контейнер LLM-Scaler-Omni beta 0.2.0-b1. Это решение объединяет работу с LLM и мультимодальными моделями. Основные нововведения:
- Обновление стека ComfyUI до версии 0.31 XPU.
- Поддержка локальной генерации видео через модель MiniMax H3.
- Работа с Wan Animate 2 на видеокартах Arc Pro B70 и B60.
- Оптимизированная поддержка моделей генерации изображений: Wan 2.2 14B T2V Turbo, LTX-2, Z-Image / Lumina и Krea2.
Технические детали и совместимость
Для пользователей, работающих с форматами GGUF, добавлена поддержка managed GGUF Q4_1 и зафиксирована интеграция ComfyUI-GGUF-XPU. Все обновления поставляются в виде Docker-контейнеров, что упрощает развертывание на базе vLLM, ComfyUI и SGLang без необходимости ручной настройки драйверов.
| Компонент LLM-Scaler | Версия | Ключевые нововведения |
|---|---|---|
| LLM-Scaler-vLLM | beta 0.21.0-b3 | Meta Muse Glimmer 30B (FP8/DFlash), Qwen3.6-27B, оптимизация Gemma-4 |
| LLM-Scaler-Omni | beta 0.2.0-b1 | ComfyUI 0.31, MiniMax H3, Wan Animate 2, Z-Image/Lumina, GGUF Q4_1 |
Почему это важно
Для энтузиастов и профессионалов, использующих Intel Arc Pro B-Series, LLM-Scaler становится единой точкой входа для запуска современных LLM и мультимодальных моделей без сложной настройки окружения. Поддержка FP8 для 30B-параметрических моделей на потребительском/профессиональном железе Intel открывает возможности для локального развертывания тяжелых ИИ-ассистентов, ранее доступных только на мощных NVIDIA-кластерах.
Источник: Phoronix ↗
