peonist-ai/halogen-flash-server

Самый быстрый способ запустить Qwen3.8-Flash-Next на Strix Halo (gfx1151)

Инференс⭐ 857Shellпоследний релиз: v0.16.2
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

halogen-flash-server — это высокоспециализированный сервер для запуска модели Qwen3.8-Flash-Next на графических процессорах AMD Strix Halo (gfx1151). Он обеспечивает экстремально высокую скорость инференса за счет кастомных ядер, написанных специально под это железо и модель.

Зачем нужен

Инструмент решает задачу максимально быстрого выполнения LLM на узкоспециализированном оборудовании AMD, избегая накладных расходов общих runtime-систем. Он полезен для разработчиков, которым нужна максимальная пропускная способность (prefill и decode) и низкая задержка при работе с длинными контекстами на архитектуре Strix Halo.

Что можно реализовать

  • Запуск Qwen3.8-Flash-Next на AMD Ryzen AI Max+ с поддержкой контекста до 131,072 токенов при высокой скорости префилла.
  • Использование в качестве бэкенда для Coding-agent с активацией speculation decoding (draft head + prompt lookup) для ускорения генерации кода.
  • Прямая работа с GGUF-файлами (например, unsloth's UD-IQ4_XS) без этапа конвертации весов.
  • Развертывание сервера через Podman/Docker с автоматической загрузкой весов и поддержкой API, совместимого с Codex и Claude Code.

Ключевые возможности

  • Производительность: префилл до 1,584 tok/s для промпта в 8,192 токенов и декодирование до 56.3 tok/s с использованием speculation.
  • Отсутствие абстракций: кастомные ядра написаны только для Strix Halo (gfx1151) и Qwen3.8-Flash-Next, без fallback-путей.
  • Точность квантования: 5.53 bpw (bits per weight) для всей модели, с прозрачной метрикой качества.
  • Поддержка длинных контекстов: эффективное кэширование промптов (prompt cache) позволяет обрабатывать follow-up turns за ~2 секунды при 100k токенов контекста.

👤 Кому подойдёт: разработчики, работающие с AMD Strix Halo, и инженеры, оптимизирующие инференс LLM под специфичное железо

Релизы