abacaj/mpt-30B-inference

Запуск inference на MPT-30B с использованием CPU

Инференс⭐ 574Python
Открыть на GitHub ↗

Что это за инструмент

Инструмент для запуска инференса модели MPT-30B на CPU с использованием квантованных весов (ggml) через библиотеку ctransformers.

Зачем нужен

Позволяет выполнять генерацию текста и чат-инференс крупной языковой модели без использования GPU, опираясь исключительно на вычислительные мощности процессора. Полезен для локального развертывания моделей среднего размера на системах с достаточным объемом оперативной памяти.

Что можно реализовать

  • Локальный запуск MPT-30B на серверах или рабочих станциях без графических ускорителей
  • Тестирование качества инференса и параметров генерации на CPU перед масштабированием
  • Разработка прототипов чат-интерфейсов с поддержкой истории диалога
  • Использование в средах с ограниченным доступом к GPU, но наличием 32+ ГБ RAM

Ключевые возможности

  • Работа с квантованной моделью (ggml) для оптимизации использования памяти
  • Поддержка режима чата с историей сообщений
  • Простая установка через Docker и Python venv
  • Тестирование на высокопроизводительных CPU (AMD Epyc 7003, Ryzen 5950x)
  • Гибкая настройка параметров генерации в скрипте

👤 Кому подойдёт: разработчики, исследователи, инженеры по машинному обучению

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.