GradientHQ/parallax

Parallax — это распределенная система для развертывания моделей, позволяющая создать свой AI-кластер в любом месте

Инференс⭐ 1 382Pythonпоследний релиз: v0.1.2
Открыть на GitHub ↗

Что это за инструмент

Parallax — это децентрализованная система для запуска моделей ИИ, позволяющая объединять разрозненные устройства с разными конфигурациями в единый кластер для инференса.

Зачем нужен

Инструмент решает задачу эффективного распределения вычислительной нагрузки между узлами с разным «железом», включая персональные компьютеры. Он полезен для создания собственных AI-кластеров без привязки к физическому местоположению нод, обеспечивая высокую производительность за счет динамического маршрутизации запросов.

Что можно реализовать

  • Хостинг локальных LLM на личных устройствах пользователей
  • Создание распределенных кластеров для инференса больших моделей (например, Qwen3.5, DeepSeek) через pipeline parallel sharding
  • Запуск инференса на устройствах с Mac, используя MLX LM
  • Интеграция с фреймворками для агентов, такими как OpenClaw

Ключевые возможности

  • Полностью децентрализованная архитектура с P2P-коммуникацией (на базе Lattica)
  • Поддержка GPU-бэкендов SGLang и vLLM, а также Mac-бэкенда MLX LM
  • Управление KV-кэшем и непрерывное батчинг (continuous batching) для Mac
  • Динамическое планирование и маршрутизация запросов для оптимизации производительности
  • Кроссплатформенная поддержка и работа с узлами разной конфигурации

👤 Кому подойдёт: разработчики, исследователи и инженеры, интересующиеся децентрализованным инференсом и созданием распределенных AI-кластеров

Релизы

v0.1.2minor
🕐 9 мес назад · релиз на GitHub ↗

Версия 0.1.2: добавлена реализация paged kv, возможность переключения моделей в чате и поддержка LoRA на macOS.

  • Added: Добавлена реализация paged kv для оптимизации работы с памятью.
  • Added: Появилась возможность переключать модели прямо на странице чата.
  • Added: Реализована поддержка LoRA для устройств на базе macOS.
  • Added: Код исполнителя (executor) разделен по различным бэкендам для лучшей модульности.
  • Обновлена версия MLX до 0.30.0 (с поддержкой arm64 wheel) и библиотека lattica до 1.0.14.