microsoft/BitNet
Официальная фреймворк для инференса 1-битных LLM
Инференс⭐ 40 296C++
Что это за инструмент
bitnet.cpp — официальный фреймворк инференса для 1-битных LLM (например, BitNet b1.58), оптимизированный для быстрого и энергоэффективного запуска на CPU и GPU.
Зачем нужен
Инструмент решает задачу эффективного развертывания LLM с экстремально низким битовым форматом (1.58 бита) на локальных устройствах. Он позволяет достигать многократного ускорения инференса и существенного снижения энергопотребления по сравнению с полноprecision моделями, делая возможным запуск больших моделей (до 100B параметров) на обычных CPU.
Что можно реализовать
- Запуск LLM размером до 100B параметров на одном CPU с производительностью, сопоставимой с чтением человеком (5-7 токенов в секунду).
- Развертывание 1-битных embedding-моделей (BitNet-embedding-0.6B/270M) для задач векторизации текста с ускорением префилла на x86 и ARM.
- Использование в системах распознавания речи (ASR) через связку с VibeASR.cpp для мультиязычного инференса в реальном времени на CPU.
- Оптимизация энергопотребления при локальном инференсе LLM на мобильных или edge-устройствах с архитектурой ARM.
- Ускорение инференса 1-битных моделей на GPU с использованием официальных GPU-кернелов.
Ключевые возможности
- Масштабное ускорение: до 6.17x на x86 CPU и до 5.07x на ARM CPU по сравнению с полноprecision моделями.
- Снижение энергопотребления: от 55.4% до 82.2% в зависимости от архитектуры процессора.
- Поддержка GPU-инференса для 1-битных моделей.
- Наличие специализированных embedding-моделей (I2_S quantization) с оптимизированными ядрами.
- Поддержка параллельных вычислений с настраиваемым тайлингом для CPU.
👤 Кому подойдёт: разработчики, исследователи, инженеры по машинному обучению, интересующиеся оптимизацией инференса LLM на CPU/GPU и edge-устройствах
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.