Инструменты17 августа 2026 г., 16:18 МСК🤖 Auto

KTransformers 0.7: AVX-512 для AMD EPYC и FP8 LoRA

Вышла версия 0.7 фреймворка KTransformers, добавляющая полную поддержку AVX-512 без AMX для AMD EPYC, нативный FP8 LoRA и оптимизации для DeepSeek V4.

Баннер новости 5925

Расширение поддержки AVX-512 для AMD EPYC

Ключевое изменение в релизе KTransformers 0.7 — полная поддержка инструкций AVX-512 при выполнении LoRA-дообучения (fine-tuning) без обязательного наличия блока Advanced Matrix Extensions (AMX). Это критически важно для серверов на базе процессоров AMD EPYC (архитектуры Zen 4, Zen 5, Zen 6), которые обладают отличной поддержкой AVX-512, но лишены AMX. Также выгода получат старые поколения Intel Xeon до Sapphire Rapids.

Рантайм KTransformers теперь автоматически выбирает оптимальную реализацию для CPU, что позволяет запускать обучение MoE-экспертов на широком спектре серверов с большим объемом памяти, не требуя специфического аппаратного обеспечения.

Новые возможности: VLM, FP8 и DeepSeek V4

Помимо оптимизаций для CPU, версия 0.7 привносит ряд значимых функций для разработчиков ИИ:

  • Поддержка VLM: Добавлена возможность дообучения мультимодальных моделей (Vision-Language Models).
  • Нативный FP8 LoRA: Внедрена поддержка формата чисел с плавающей точкой FP8 для адаптации весов, что снижает требования к памяти и ускоряет вычисления.
  • DeepSeek V4: Улучшена поддержка развертывания модели DeepSeek V4.
  • Reuse Activation: Введена оптимизация повторного использования активаций на CPU, повышающая эффективность инференса.

Технические детали и совместимость

Разработчики акцентируют внимание на том, что фреймворк остается инструментом для гетерогенных вычислений, оптимизируя как инференс, так и дообучение больших языковых моделей (LLM). Автоматическое определение архитектуры процессора позволяет пользователям не настраивать параметры вручную, а сразу получать прирост производительности на доступном железе.

Функция Описание Целевая аудитория/Железо
AVX-512 без AMX Поддержка LoRA-дообучения через AVX-512 AMD EPYC (Zen 4/5/6), старые Intel Xeon
FP8 LoRA Нативная поддержка 8-битной плавающей точки Все пользователи, экономящие VRAM
VLM Fine-tuning Дообучение зрительно-языковых моделей Разработчики мультимодальных ИИ
DeepSeek V4 Улучшенное развертывание Пользователи модели DeepSeek

Полный список изменений и детали для разработчиков доступны в официальном объявлении о релизе на GitHub.

Источник: Phoronix ↗