dvmazur/mixtral-offloading
Запуск моделей Mixtral-8x7B в Colab или на потребительских десктопах
Инференс⭐ 2 336Python
Что это за инструмент
Инструмент для эффективного запуска модели Mixtral-8x7B на устройствах с ограниченной памятью, таких как Google Colab или потребительские десктопы.
Зачем нужен
Решает проблему нехватки VRAM для запуска больших MoE-моделей, комбинируя смешанное квантование HQQ и стратегию offloading экспертов. Это позволяет использовать как GPU, так и CPU память, загружая активные эксперты в GPU только по мере необходимости через LRU-кэш.
Что можно реализовать
- Запуск Mixtral-8x7B в бесплатном или дешевом Google Colab
- Локальный инференс на десктопах с потребительскими видеокартами
- Оптимизация потребления памяти при генерации текста с помощью MoE-архитектуры
- Эксперименты с квантованием и управлением памятью для больших языковых моделей
Ключевые возможности
- Смешанное квантование с HQQ для разных слоев (attention и experts)
- Offloading экспертов: загрузка в GPU только активных модулей
- LRU-кэш для минимизации трафика между GPU и RAM
- Наличие демо-ноутбука для быстрого старта
- Открытый код с возможностью создания своих скриптов запуска
👤 Кому подойдёт: разработчики, исследователи, энтузиасты AI, работающие с ресурсами ограниченной мощности
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.