microsoft/BitNet

Официальная фреймворк для инференса 1-битных LLM

Инференс⭐ 40 296C++
Открыть на GitHub ↗

Что это за инструмент

bitnet.cpp — официальный фреймворк инференса для 1-битных LLM (например, BitNet b1.58), оптимизированный для быстрого и энергоэффективного запуска на CPU и GPU.

Зачем нужен

Инструмент решает задачу эффективного развертывания LLM с экстремально низким битовым форматом (1.58 бита) на локальных устройствах. Он позволяет достигать многократного ускорения инференса и существенного снижения энергопотребления по сравнению с полноprecision моделями, делая возможным запуск больших моделей (до 100B параметров) на обычных CPU.

Что можно реализовать

  • Запуск LLM размером до 100B параметров на одном CPU с производительностью, сопоставимой с чтением человеком (5-7 токенов в секунду).
  • Развертывание 1-битных embedding-моделей (BitNet-embedding-0.6B/270M) для задач векторизации текста с ускорением префилла на x86 и ARM.
  • Использование в системах распознавания речи (ASR) через связку с VibeASR.cpp для мультиязычного инференса в реальном времени на CPU.
  • Оптимизация энергопотребления при локальном инференсе LLM на мобильных или edge-устройствах с архитектурой ARM.
  • Ускорение инференса 1-битных моделей на GPU с использованием официальных GPU-кернелов.

Ключевые возможности

  • Масштабное ускорение: до 6.17x на x86 CPU и до 5.07x на ARM CPU по сравнению с полноprecision моделями.
  • Снижение энергопотребления: от 55.4% до 82.2% в зависимости от архитектуры процессора.
  • Поддержка GPU-инференса для 1-битных моделей.
  • Наличие специализированных embedding-моделей (I2_S quantization) с оптимизированными ядрами.
  • Поддержка параллельных вычислений с настраиваемым тайлингом для CPU.

👤 Кому подойдёт: разработчики, исследователи, инженеры по машинному обучению, интересующиеся оптимизацией инференса LLM на CPU/GPU и edge-устройствах

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.