dvmazur/mixtral-offloading

Запуск моделей Mixtral-8x7B в Colab или на потребительских десктопах

Инференс⭐ 2 336Python
Открыть на GitHub ↗

Что это за инструмент

Инструмент для эффективного запуска модели Mixtral-8x7B на устройствах с ограниченной памятью, таких как Google Colab или потребительские десктопы.

Зачем нужен

Решает проблему нехватки VRAM для запуска больших MoE-моделей, комбинируя смешанное квантование HQQ и стратегию offloading экспертов. Это позволяет использовать как GPU, так и CPU память, загружая активные эксперты в GPU только по мере необходимости через LRU-кэш.

Что можно реализовать

  • Запуск Mixtral-8x7B в бесплатном или дешевом Google Colab
  • Локальный инференс на десктопах с потребительскими видеокартами
  • Оптимизация потребления памяти при генерации текста с помощью MoE-архитектуры
  • Эксперименты с квантованием и управлением памятью для больших языковых моделей

Ключевые возможности

  • Смешанное квантование с HQQ для разных слоев (attention и experts)
  • Offloading экспертов: загрузка в GPU только активных модулей
  • LRU-кэш для минимизации трафика между GPU и RAM
  • Наличие демо-ноутбука для быстрого старта
  • Открытый код с возможностью создания своих скриптов запуска

👤 Кому подойдёт: разработчики, исследователи, энтузиасты AI, работающие с ресурсами ограниченной мощности

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.