abacaj/mpt-30B-inference
Запуск inference на MPT-30B с использованием CPU
Инференс⭐ 574Python
Что это за инструмент
Инструмент для запуска инференса модели MPT-30B на CPU с использованием квантованных весов (ggml) через библиотеку ctransformers.
Зачем нужен
Позволяет выполнять генерацию текста и чат-инференс крупной языковой модели без использования GPU, опираясь исключительно на вычислительные мощности процессора. Полезен для локального развертывания моделей среднего размера на системах с достаточным объемом оперативной памяти.
Что можно реализовать
- Локальный запуск MPT-30B на серверах или рабочих станциях без графических ускорителей
- Тестирование качества инференса и параметров генерации на CPU перед масштабированием
- Разработка прототипов чат-интерфейсов с поддержкой истории диалога
- Использование в средах с ограниченным доступом к GPU, но наличием 32+ ГБ RAM
Ключевые возможности
- Работа с квантованной моделью (ggml) для оптимизации использования памяти
- Поддержка режима чата с историей сообщений
- Простая установка через Docker и Python venv
- Тестирование на высокопроизводительных CPU (AMD Epyc 7003, Ryzen 5950x)
- Гибкая настройка параметров генерации в скрипте
👤 Кому подойдёт: разработчики, исследователи, инженеры по машинному обучению
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.