Tiiny-AI/PowerInfer
Высокоскоростной сервис LLM для локального развертывания
Инференс⭐ 9 803C++
Что это за инструмент
PowerInfer — это высокопроизводительный движок для локального запуска LLM, использующий гибридную архитектуру CPU/GPU и принцип локальности активаций.
Зачем нужен
Инструмент решает проблему нехватки VRAM на потребительских видеокартах, позволяя запускать модели огромного размера (например, 40B+) на одном GPU. Он ускоряет инференс за счет хранения «горячих» нейронов на GPU, а «холодных» — на CPU, что снижает задержки и трафик между устройствами.
Что можно реализовать
- Локальный запуск больших моделей (например, Falcon-40B) на одной видеокарте уровня RTX 4090
- Создание быстрых LLM-серверов для локального использования с минимальными требованиями к памяти
- Оптимизация инференса на мобильных устройствах (смартфонах) с использованием TurboSparse
- Запуск LLM на оборудовании AMD с поддержкой ROCm
Ключевые возможности
- Гибридная CPU/GPU архитектура, использующая распределение активаций (hot/cold neurons)
- Ускорение инференса до 11.69x по сравнению с llama.cpp на одном GPU
- Поддержка ReLU-sparse моделей с высокой степенью разреженности (~90%)
- Совместимость с примерами и форматами, аналогичными llama.cpp
- Работа на потребительском железе (PC, смартфоны) без серверных GPU
👤 Кому подойдёт: разработчики, интересующиеся оптимизацией LLM, и энтузиасты, желающие запускать большие модели на локальном оборудовании
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.