InferenceX

多模型多硬件推理压测,一键跑出可比性能数据

InferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniMax、DeepSeek、GLM 系列)部署到不同硬件平台(GB200 NVL72、MI355X、B200、GB300 NVL72,并规划支持 TPUv6e/v7、Trainium2/3)上,统一测量吞吐、延迟、并发等关键指标,解决推理优化中硬件选型、框架调优缺乏横向可比数据的问题。核心能力包括:多模型多硬件矩阵化压测、持续回归式基准跑分、面向 agentic 与 llm-serving 场景的负载模拟,以及结果可复现的配置管理。项目用 Python 实现,适合 MLOps、推理服务团队和硬件厂商做容量规划与性能验证。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1710
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类评测安全
开发团队SemiAnalysisAI
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型agentic,agentic-ai,amd,benchmarking,benchmarks,cuda,deepseek,gpu,inference,kimi,llm-inference,llm-serving,mlops,nvidia,pytorch,qwen,rocm,sglang,tensorrt-llm,vllm
GitHub 星标★ 1710
30天Star增速
HF 下载量
上线时间2025-07-12 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

难度:高级 约 10 分钟 部署方式:命令行工具 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目开发语言为 Python)
  • 兼容的推理硬件平台:NVIDIA GB200 NVL72 / GB300 NVL72 / B200,或 AMD MI355X(规划支持 TPUv6e/v7、Tr
  • 可访问 GitHub 与官方看板的网络环境
  • 支持 CUDA(NVIDIA)或对应加速栈的驱动环境

安装与启动步骤

  1. 1克隆代码仓库

    从 GitHub 拉取 InferenceX 仓库到本地,README 未给出其他安装方式,请以仓库内最新文档为准。

    git clone https://github.com/SemiAnalysisAI/InferenceX.git
  2. 2进入项目目录

    切换到克隆下来的仓库根目录,查看其中是否提供安装与运行脚本。

    cd InferenceX
  3. 3阅读中文说明

    仓库同时提供中文 README,先通读以确认实际安装步骤与依赖,避免按英文文档误操作。

  4. 4打开官方看板

    无需本地部署也可先通过官方在线看板查看持续基准跑分结果与多模型多硬件对比数据。

如何确认成功

打开 https://inferencex.semianalysis.com/ 能否正常加载基准数据;本地则确认仓库克隆成功且能读到 README_zh.md。

常见问题

Q:README 里没有安装命令怎么办?

A:本教程节选未包含安装说明,仅能给出克隆与查阅文档的准备步骤。请以仓库最新 README 和官网文档为准,不要自行猜测依赖安装命令。

Q:必须有高端 GPU 才能用吗?

A:项目定位是在 GB200 NVL72、MI355X、B200、GB300 NVL72 等平台做大规模推理压测,本地无对应硬件时建议直接看官方在线看板结果。

Q:支持哪些模型?

A:README 提到覆盖 Kimi、MiniMax、DeepSeek、GLM 等主流大模型系列,并持续更新新模型(如 Kimi K3、GLM5.3)的持续基准。

Q:能自己复现跑分吗?

A:项目强调结果可复现的配置管理,但具体复现命令需参考仓库内文档;README 节选中未给出,请查阅仓库说明。

Q:有中文文档吗?

A:有,仓库根目录提供 README_zh.md,可在英文 README 顶部切换至中文版本。

注意事项

  • 本教程所依据的 README 节选未包含安装、依赖与运行命令,除 git clone 外的步骤均需以仓库最新文档为准。
  • 硬件门槛较高,主要面向数据中心级 GPU 平台,个人环境建议先使用官方在线看板。
  • 项目采用 Apache 2.0 开源协议,可自由使用与二次开发。
  • 不要凭猜测执行 pip install 或 docker run 等命令,需先在仓库中找到对应说明。

核心亮点

  • 覆盖 GB200 NVL72、MI355X、B200、GB300 NVL72 等多种旗舰推理硬件,横向对比数据稀缺且实用
  • 支持 Kimi、MiniMax、DeepSeek、GLM 等主流大模型,贴近真实生产模型组合
  • 定位持续基准研究平台,强调可复现与回归测试,适合长期跟踪推理性能变化

不足之处

  • 项目较新、星标仍在成长中,长期维护与社区生态有待观察
  • 依赖高端 GPU/NPU 硬件,普通开发者难以本地复现全部基准

适用场景

  • 推理服务团队做 GPU 选型与容量规划
  • 硬件厂商验证新卡在主流大模型上的推理表现
  • MLOps 团队建立持续推理性能回归监控

替代项目

vLLM、MLPerf Inference

项目介绍

InferenceX 是一个评测安全领域的开源项目,官方简介:Open Source Continuous Inference Benchmark Research Platform — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 & soon™ TPUv6e/v7/Trainium2/3 | 开源持续推理基准研究平台 — Kimi K2.7-Code、MiniMax M3、DeepSeekv4、GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72,即将推出™ TPUv6e/v7/Trainium2/3。项目使用 Python 开发,在 GitHub 上获得 1670 星标。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24