bigscience-workshop/petals

Запускай LLM дома по принципу BitTorrent. Fine-tuning и inference до 10x быстрее, чем offloading

Инференс⭐ 10 583Pythonпоследний релиз: v2.2.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Petals — это распределенная система, позволяющая запускать крупные языковые модели (LLM) локально, используя BitTorrent-подобную сеть, где слои модели распределены между участниками.

Зачем нужен

Инструмент решает проблему нехватки видеопамяти (VRAM) для работы с моделями размером до 405B параметров, обеспечивая инференс и дообучение до 10x быстрее, чем при стандартном offloading. Он позволяет использовать мощные модели с обычного компьютера или Google Colab, объединяя вычислительные ресурсы сообщества.

Что можно реализовать

  • Запуск инференса для Llama 3.1 (405B), Mixtral (8x22B), Falcon (40B+) или BLOOM (176B) на домашнем ПК без серверной GPU.
  • Создание интерактивных чат-ботов и приложений, требующих скорости до 6 токенов/сек.
  • Проведение fine-tuning (дообучения) больших моделей для специфических задач с использованием PyTorch и Transformers.
  • Участие в публичном рою (swarm) путем предоставления своей GPU для обслуживания других пользователей.
  • Запуск приватного роя (private swarm) для обработки конфиденциальных данных среди доверенных лиц.

Ключевые возможности

  • Работа с моделями до 405B параметров на клиентском оборудовании с ограниченной памятью.
  • Полная совместимость с библиотеками PyTorch и Hugging Face Transformers.
  • Поддержка различных методов сэмплирования, fine-tuning и доступа к скрытым состояниям модели.
  • Гибкие варианты развёртывания: Linux, Windows (WSL), macOS (Apple M1/M2) и Docker.
  • Возможность настройки приватных сетей для обеспечения безопасности данных.

👤 Кому подойдёт: разработчики, исследователи, энтузиасты AI, желающие экспериментировать с крупными моделями без доступа к мощным серверным GPU

Релизы

v2.2.0major
🕐 37 мес назад · релиз на GitHub ↗

Petals 2.2.0: поддержка Falcon, нативный macOS, кастомные модели и исправления.

  • Added: Добавлена поддержка моделей Falcon, включая Falcon 180B, с оптимизацией скорости.
  • Added: Реализована нативная работа клиентов и серверов на macOS с использованием Apple Silicon.
  • Added: Кастомные модели автоматически отображаются в индексе с пометкой «не поддерживаются официально».
  • Fixed: Исправлена работа моделей с prefix-tuning, сломанная в версии 2.1.0.