KTransformers v0.6.4: поддержка LoRA и полного дообучения MoE, ускорение на CPU/GPU, запуск DeepSeek V4 на Ampere и экспериментальный бэкенд для Intel iGPU.
- Added: Добавлена поддержка полного дообучения (Full-Parameter), LoRA и гибридных конфигураций для больших разреженных MoE-моделей через LLaMA-Factory.
- Added: Значительно повышена пропускная способность обучения: до 400 токенов/с при полном дообучении и до 700 токенов/с при LoRA на конфигурациях с CPU и GPU.
- Added: Расширена поддержка DeepSeek V4 Flash на GPU архитектуры Ampere за счет бэкапов BF16 и интеграции FP8 MoE Marlin.
- Added: Введен экспериментальный SYCL-бэкенд для инференса GPTQ INT4 MoE на интегрированных графических процессорах Intel.
- Added: Улучшена совместимость и ускорен префилл для RAWINT4: поддержка сжатых весов, загрузка экспертов на AVX-VNNI-256 и оптимизация для Kimi K2.
- Fixed: Исправлена уязвимость безопасности: планировщик balance_serve теперь привязывает ZMQ ROUTER к localhost, предотвращая удаленную десериализацию.