Вышла версия v0.16.2.
peonist-ai/halogen-flash-server
Самый быстрый способ запустить Qwen3.8-Flash-Next на Strix Halo (gfx1151)
Что это за инструмент
halogen-flash-server — это высокоспециализированный сервер для запуска модели Qwen3.8-Flash-Next на графических процессорах AMD Strix Halo (gfx1151). Он обеспечивает экстремально высокую скорость инференса за счет кастомных ядер, написанных специально под это железо и модель.
Зачем нужен
Инструмент решает задачу максимально быстрого выполнения LLM на узкоспециализированном оборудовании AMD, избегая накладных расходов общих runtime-систем. Он полезен для разработчиков, которым нужна максимальная пропускная способность (prefill и decode) и низкая задержка при работе с длинными контекстами на архитектуре Strix Halo.
Что можно реализовать
- Запуск Qwen3.8-Flash-Next на AMD Ryzen AI Max+ с поддержкой контекста до 131,072 токенов при высокой скорости префилла.
- Использование в качестве бэкенда для Coding-agent с активацией speculation decoding (draft head + prompt lookup) для ускорения генерации кода.
- Прямая работа с GGUF-файлами (например, unsloth's UD-IQ4_XS) без этапа конвертации весов.
- Развертывание сервера через Podman/Docker с автоматической загрузкой весов и поддержкой API, совместимого с Codex и Claude Code.
Ключевые возможности
- Производительность: префилл до 1,584 tok/s для промпта в 8,192 токенов и декодирование до 56.3 tok/s с использованием speculation.
- Отсутствие абстракций: кастомные ядра написаны только для Strix Halo (gfx1151) и Qwen3.8-Flash-Next, без fallback-путей.
- Точность квантования: 5.53 bpw (bits per weight) для всей модели, с прозрачной метрикой качества.
- Поддержка длинных контекстов: эффективное кэширование промптов (prompt cache) позволяет обрабатывать follow-up turns за ~2 секунды при 100k токенов контекста.
👤 Кому подойдёт: разработчики, работающие с AMD Strix Halo, и инженеры, оптимизирующие инференс LLM под специфичное железо