kvcache-ai/ktransformers

A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations

Инференс⭐ 19 528Pythonпоследний релиз: v0.7.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

KTransformers — это фреймворк для оптимизации инференса и дообучения больших языковых моделей (LLM) за счет использования гибридных вычислений CPU-GPU.

Зачем нужен

Инструмент позволяет запускать тяжелые модели на оборудовании с ограниченным объемом VRAM, распределяя нагрузку между процессором и видеокартой. Он полезен для снижения затрат на инфраструктуру и повышения производительности за счет специализированных ядер (AMX/AVX) и квантования.

Что можно реализовать

  • Инференс больших моделей (например, DeepSeek-V3/R1, Kimi-K2) на GPU с малым объемом памяти (от 24 ГБ) или на системах без GPU.
  • Дообучение (SFT) и RL-DPO моделей с использованием интеграции LLaMA-Factory.
  • Оптимизация работы MoE-архитектур (Mixture-of-Experts) с помощью специализированных CPU-ядер.
  • Развертывание LLM на Intel Arc GPU или AMD GPU (ROCm) с поддержкой квантования INT4/INT8.

Ключевые возможности

  • Гибридные вычисления CPU-GPU для снижения требований к VRAM.
  • Поддержка Intel AMX и AVX512/AVX2 для ускорения инференса.
  • Нативная поддержка квантования BF16, FP8 и INT4/INT8.
  • Интеграция с SGLang и LLaMA-Factory для инференса и обучения.
  • Широкая поддержка актуальных моделей (Kimi, GLM, MiniMax, Qwen, DeepSeek).

👤 Кому подойдёт: ML-инженеры, исследователи и разработчики, работающие с LLM на ограниченном или разнородном оборудовании.

Релизы

v0.7.1minor
🕐 6 дн назад · релиз на GitHub ↗

KTransformers v0.7.1: добавлена LoRA-дообучка Qwen VLM и Kimi K2.5/K2.6 через LLaMA-Factory.

  • Added: Поддержка BF16 LoRA-дообучения Qwen3-VL-30B-A3B-Instruct и Qwen3.5-35B-A3B с учётом модулей MoE.
  • Added: Нативное LoRA-дообучение Kimi K2.5/K2.6 в RAWINT4 без разворачивания весов в BF16.
  • Added: Интеграция дообучения через LLaMA-Factory для мультимодальных и диалоговых задач.
  • Added: CPU–GPU гетерогенное выполнение для адаптации мультимодальных моделей и персонализации диалога.
v0.7.0major
🕐 1 мес назад · релиз на GitHub ↗

KTransformers v0.7.0: полная поддержка AVX512 для LoRA, нативный FP8 для DeepSeek-V3.1, запуск DeepSeek V4 через Docker и оптимизация CPU-активаций.

  • Added: Полная поддержка тонкой настройки LoRA на CPU с инструкциями AVX512 без необходимости AMX.
  • Added: Нативная поддержка FP8 LoRA для DeepSeek-V3.1, снижающая потребление памяти с 1.4 ТБ до 800 ГБ.
  • Added: Добавлено руководство по быстрой развёртке DeepSeek V4 через Docker.
  • Added: Реализовано повторное использование CPU-активаций для повышения пропускной способности обучения.
v0.6.4major
🕐 2 мес назад · релиз на GitHub ↗

KTransformers v0.6.4: поддержка LoRA и полного дообучения MoE, ускорение на CPU/GPU, запуск DeepSeek V4 на Ampere и экспериментальный бэкенд для Intel iGPU.

  • Added: Добавлена поддержка полного дообучения (Full-Parameter), LoRA и гибридных конфигураций для больших разреженных MoE-моделей через LLaMA-Factory.
  • Added: Значительно повышена пропускная способность обучения: до 400 токенов/с при полном дообучении и до 700 токенов/с при LoRA на конфигурациях с CPU и GPU.
  • Added: Расширена поддержка DeepSeek V4 Flash на GPU архитектуры Ampere за счет бэкапов BF16 и интеграции FP8 MoE Marlin.
  • Added: Введен экспериментальный SYCL-бэкенд для инференса GPTQ INT4 MoE на интегрированных графических процессорах Intel.
  • Added: Улучшена совместимость и ускорен префилл для RAWINT4: поддержка сжатых весов, загрузка экспертов на AVX-VNNI-256 и оптимизация для Kimi K2.
  • Fixed: Исправлена уязвимость безопасности: планировщик balance_serve теперь привязывает ZMQ ROUTER к localhost, предотвращая удаленную десериализацию.
v0.6.3major
🕐 3 мес назад · релиз на GitHub ↗

Добавлена поддержка моделей MiniMax-M3 и GLM-5.2, внедрен полный цикл KT LoRA для Qwen3.5 MoE и улучшена работа с MXFP8.

  • Added: Добавлена поддержка моделей MiniMax-M3 и GLM-5.2 с использованием CPU-GPU гетерогенного инференса и NSA-бэкенда.
  • Added: Реализован полный цикл KT LoRA для Qwen3.5 MoE: от SFT до сервинга через SGLang с автоматическим разделением весов.
  • Added: Добавлена поддержка MXFP8 для MoE-моделей на GPU Hopper и улучшена работа с экспертами через kt-kernel.
  • Fixed: Исправлен сброс CudaGraph и добавлены логи запуска для MoE, а также устранена ошибка импорта kt_ep_wrapper.