SJTU-IPADS/PowerInfer
Высокоскоростной сервис для локального развертывания больших языковых моделей
Инференс⭐ 9 801C++
Что это за инструмент
PowerInfer — это высокопроизводительный движок инференса LLM для локального развертывания, использующий гибридную архитектуру CPU/GPU и принцип локальности активаций.
Зачем нужен
Инструмент позволяет запускать крупные языковые модели (включая модели с сотнями миллиардов параметров) на потребительских GPU (например, RTX 4090), значительно экономя VRAM. Он достигает скорости генерации, близкой к серверным решениям уровня A100, превосходя аналоги вроде llama.cpp в несколько раз за счет вычисления «горячих» нейронов на GPU, а «холодных» — на CPU.
Что можно реализовать
- Локальный инференс больших моделей (например, Falcon-40B, OPT-175B) на одной видеокарте с ограниченным объемом памяти.
- Развертывание LLM-серверов с низкой задержкой для личных или корпоративных нужд без использования облачных GPU.
- Оптимизация работы с ReLU-моделями с высокой степенью разреженности (sparsity) для ускорения вычислений.
- Запуск LLM на мобильных устройствах (смартфонах) с использованием специализированных фреймворков PowerInfer-2.
Ключевые возможности
- Гибридная архитектура: разделение вычислений между GPU и CPU на основе активации нейронов (hot/cold neurons).
- Высокая скорость: до 29.08 tokens/s на RTX 4090, что в 11.69 раза быстрее llama.cpp для некоторых моделей.
- Поддержка Windows и AMD GPU (через ROCm) наряду с NVIDIA.
- Совместимость с популярными ReLU-sparse моделями и возможность использования примеров серверной части, аналогичных llama.cpp.
👤 Кому подойдёт: разработчики, исследователи и энтузиасты, интересующиеся локальным развертыванием LLM на потребительском оборудовании
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.