thu-pacman/chitu

Высокопроизводительный фреймворк для inference больших языковых моделей, ориентированный на эффективность, гибкость и доступность.

Инференс⭐ 3 005Pythonпоследний релиз: v0.6.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Chitu — это высокопроизводительный фреймворк для инференса больших языковых моделей (LLM), ориентированный на эффективность, гибкость и стабильность в продакшене.

Зачем нужен

Инструмент решает задачу развертывания LLM от единичных тестов до масштабных кластерных инсталляций, обеспечивая поддержку разнообразного аппаратного обеспечения. Он полезен для оптимизации производительности и снижения затрат за счет квантования и эффективных операторов, а также для обеспечения стабильной работы под высокой нагрузкой.

Что можно реализовать

  • Развертывание LLM на неоднородных кластерах с использованием PD-разделения (Prompt Encoder / Decoder) и мульти-нод.
  • Инференс на国产 GPU (Huawei Ascend 910B, Moore Threads, MetaX, Hygon) и NVIDIA.
  • Запуск огромных моделей (например, DeepSeek-R1 671B) на ограниченном оборудовании с использованием CPU+GPU гетерогенного инференса.
  • Использование квантования FP4 для ускорения работы с моделями, поддерживающими этот формат.

Ключевые возможности

  • Поддержка широкого спектра GPU: NVIDIA, Huawei Ascend, Moore Threads, MetaX, Hygon.
  • Поддержка сложных архитектур: PD-разделение, мульти-нод, CPU+GPU гетерогенный инференс.
  • Эффективные оптимизации: FP4 онлайн-квантование, FP8/BF16 операторы.
  • Простой деплой через единый исполняемый файл chitu.run.
  • Поддержка популярных моделей: DeepSeek, Qwen, GLM, Kimi.

👤 Кому подойдёт: ML-инженеры, DevOps-специалисты и компании, развертывающие LLM в продакшене, особенно использующие国产 GPU или требующие высокой масштабируемости.

Релизы

v0.6.0major
🕐 2 мес назад · релиз на GitHub ↗

Chitu v0.6.0: запуск через chitu.run, поддержка GLM-5.2 и DeepSeek-V4, Prefill CP и оптимизации для Ascend/Hygon.

  • Added: Добавлен chitu.run — единый исполняемый файл для запуска сложных задач с PD-разделением и мультинодовостью.
  • Added: Добавлена поддержка модели GLM-5.2 и запуск GLM-5 на платформе Ascend 910B.
  • Added: Внедрена контекстная параллельность при префилле (Prefill CP) для DeepSeek-V3.x и GLM-5.x.
  • Added: Добавлена поддержка вызова инструментов (tool calling) для DeepSeek-V4 и параметра reasoning_effort.
  • Fixed: Исправлены ошибки выделения KV-кэша, дедлоки, переполнение буферов EP и проблемы с MoE-диспетчером.
  • Added: Оптимизирована работа с платформами Hygon и добавлены новые Triton-операторы для MoE и LayerNorm.