SJTU-IPADS/PowerInfer

Высокоскоростной сервис для локального развертывания больших языковых моделей

Инференс⭐ 9 801C++
Открыть на GitHub ↗

Что это за инструмент

PowerInfer — это высокопроизводительный движок инференса LLM для локального развертывания, использующий гибридную архитектуру CPU/GPU и принцип локальности активаций.

Зачем нужен

Инструмент позволяет запускать крупные языковые модели (включая модели с сотнями миллиардов параметров) на потребительских GPU (например, RTX 4090), значительно экономя VRAM. Он достигает скорости генерации, близкой к серверным решениям уровня A100, превосходя аналоги вроде llama.cpp в несколько раз за счет вычисления «горячих» нейронов на GPU, а «холодных» — на CPU.

Что можно реализовать

  • Локальный инференс больших моделей (например, Falcon-40B, OPT-175B) на одной видеокарте с ограниченным объемом памяти.
  • Развертывание LLM-серверов с низкой задержкой для личных или корпоративных нужд без использования облачных GPU.
  • Оптимизация работы с ReLU-моделями с высокой степенью разреженности (sparsity) для ускорения вычислений.
  • Запуск LLM на мобильных устройствах (смартфонах) с использованием специализированных фреймворков PowerInfer-2.

Ключевые возможности

  • Гибридная архитектура: разделение вычислений между GPU и CPU на основе активации нейронов (hot/cold neurons).
  • Высокая скорость: до 29.08 tokens/s на RTX 4090, что в 11.69 раза быстрее llama.cpp для некоторых моделей.
  • Поддержка Windows и AMD GPU (через ROCm) наряду с NVIDIA.
  • Совместимость с популярными ReLU-sparse моделями и возможность использования примеров серверной части, аналогичных llama.cpp.

👤 Кому подойдёт: разработчики, исследователи и энтузиасты, интересующиеся локальным развертыванием LLM на потребительском оборудовании

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.