Tiiny-AI/PowerInfer

Высокоскоростной сервис LLM для локального развертывания

Инференс⭐ 9 803C++
Открыть на GitHub ↗

Что это за инструмент

PowerInfer — это высокопроизводительный движок для локального запуска LLM, использующий гибридную архитектуру CPU/GPU и принцип локальности активаций.

Зачем нужен

Инструмент решает проблему нехватки VRAM на потребительских видеокартах, позволяя запускать модели огромного размера (например, 40B+) на одном GPU. Он ускоряет инференс за счет хранения «горячих» нейронов на GPU, а «холодных» — на CPU, что снижает задержки и трафик между устройствами.

Что можно реализовать

  • Локальный запуск больших моделей (например, Falcon-40B) на одной видеокарте уровня RTX 4090
  • Создание быстрых LLM-серверов для локального использования с минимальными требованиями к памяти
  • Оптимизация инференса на мобильных устройствах (смартфонах) с использованием TurboSparse
  • Запуск LLM на оборудовании AMD с поддержкой ROCm

Ключевые возможности

  • Гибридная CPU/GPU архитектура, использующая распределение активаций (hot/cold neurons)
  • Ускорение инференса до 11.69x по сравнению с llama.cpp на одном GPU
  • Поддержка ReLU-sparse моделей с высокой степенью разреженности (~90%)
  • Совместимость с примерами и форматами, аналогичными llama.cpp
  • Работа на потребительском железе (PC, смартфоны) без серверных GPU

👤 Кому подойдёт: разработчики, интересующиеся оптимизацией LLM, и энтузиасты, желающие запускать большие модели на локальном оборудовании

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.
Tiiny-AI/PowerInfer — GitHub-трекер AIKraft | AIKraft