SemiAnalysisAI/InferenceX

Открытая платформа для исследований непрерывного инференса — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 — GB200 NVL72 против MI355X, B200, GB300 NVL72 и скоро™ TPUv6e/v7/Trainium2/3

Инференс⭐ 1 742Pythonпоследний релиз: tilert-v0.1.5.post2-inferencex.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

InferenceX — это открытая исследовательская платформа для непрерывного бенчмаркинга производительности LLM-инференса, предоставляющая живые дашборды с актуальными метриками.

Зачем нужен

Инструмент решает проблему устаревания статических тестов, так как программные стеки (vLLM, SGLang, TensorRT-LLM) обновляются ежедневно. InferenceX позволяет отслеживать реальную производительность в near real-time, фиксируя прирост скорости от оптимизации ядер и стратегий распределенного инференса.

Что можно реализовать

  • Сравнение производительности различных GPU (NVIDIA Blackwell, AMD MI355X, Hopper) на актуальных версиях фреймворков
  • Мониторинг эволюции производительности моделей (Kimi K3, DeepSeekv4, GLM5) с момента их выхода (Day 0)
  • Оценка эффективности длинных контекстов и многошаговых агентов через специализированный бенчмарк AgentX
  • Анализ влияния обновлений ПО на метрики инференса без необходимости проведения собственных тестов

Ключевые возможности

  • Непрерывный (continuous) сбор данных: результаты обновляются по мере выхода новых версий ПО
  • Поддержка широкого спектра железа: от GB300 NVL72 и MI355X до ожидаемых TPUv7 и Vera Rubin
  • Официальный статус и доверие индустрии: используется операторами 'token factories' (OpenAI, Meta, Microsoft) и сообществами PyTorch, vLLM
  • Полная открытость кода и данных под лицензией Apache 2.0 с публичным дашбордом

👤 Кому подойдёт: ML-исследователи, инженеры по машинному обучению, архитекторы AI-инфраструктуры и технические лидеры, оценивающие выбор GPU и оптимизацию инференса

Релизы

tilert-v0.1.5.post2-inferencex.1patch
🕐 недавно · релиз на GitHub ↗

Вышла версия tilert-v0.1.5.post2-inferencex.1.