Вышла версия tilert-v0.1.5.post2-inferencex.1.
SemiAnalysisAI/InferenceX
Открытая платформа для исследований непрерывного инференса — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 — GB200 NVL72 против MI355X, B200, GB300 NVL72 и скоро™ TPUv6e/v7/Trainium2/3
Что это за инструмент
InferenceX — это открытая исследовательская платформа для непрерывного бенчмаркинга производительности LLM-инференса, предоставляющая живые дашборды с актуальными метриками.
Зачем нужен
Инструмент решает проблему устаревания статических тестов, так как программные стеки (vLLM, SGLang, TensorRT-LLM) обновляются ежедневно. InferenceX позволяет отслеживать реальную производительность в near real-time, фиксируя прирост скорости от оптимизации ядер и стратегий распределенного инференса.
Что можно реализовать
- Сравнение производительности различных GPU (NVIDIA Blackwell, AMD MI355X, Hopper) на актуальных версиях фреймворков
- Мониторинг эволюции производительности моделей (Kimi K3, DeepSeekv4, GLM5) с момента их выхода (Day 0)
- Оценка эффективности длинных контекстов и многошаговых агентов через специализированный бенчмарк AgentX
- Анализ влияния обновлений ПО на метрики инференса без необходимости проведения собственных тестов
Ключевые возможности
- Непрерывный (continuous) сбор данных: результаты обновляются по мере выхода новых версий ПО
- Поддержка широкого спектра железа: от GB300 NVL72 и MI355X до ожидаемых TPUv7 и Vera Rubin
- Официальный статус и доверие индустрии: используется операторами 'token factories' (OpenAI, Meta, Microsoft) и сообществами PyTorch, vLLM
- Полная открытость кода и данных под лицензией Apache 2.0 с публичным дашбордом
👤 Кому подойдёт: ML-исследователи, инженеры по машинному обучению, архитекторы AI-инфраструктуры и технические лидеры, оценивающие выбор GPU и оптимизацию инференса