
LLMServingSim
不买卡也能仿真 LLM 推理集群的吞吐与延迟
LLMServingSim 2.0 是一个面向大语言模型(LLM)推理服务基础设施的仿真器,专为异构硬件与分离式(disaggregated)部署场景设计。它解决的核心问题是:在真实集群上评估 LLM 服务系统(如调度策略、并行方案、PD 分离架构)成本高、周期长、难以复现。该工具通过建模 GPU/加速器、内存、网络带宽与延迟,模拟请求在 prefill 与 decode 阶段的执行与调度过程,从而在不依赖真实硬件的情况下预测吞吐、延迟与资源利用率。它支持异构设备组合与分离式架构,便于研究人员快速对比不同系统设计,降低实验门槛,并为生产部署提供容量规划参考。
开源
unknown
基础设施
GitHub 星标
★ 402
维护状态
较活跃
是否开源
是
定价模式
unknown
项目数据
分类基础设施
开发团队casys-kaist
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 402
30天Star增速
HF 下载量
上线时间2024-07-23 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 支持异构硬件与 PD 分离架构建模,贴近真实生产部署形态
- 纯 Python 实现,便于研究人员修改调度策略与并行方案
- 可在无 GPU 环境下评估系统设计,降低实验成本与门槛
不足之处
- 仿真精度依赖建模假设,与真实硬件行为可能存在偏差
- 项目星标仅 400,生态与文档成熟度相对有限
适用场景
- 研究新型 LLM 服务调度算法时快速对比吞吐与延迟
- 规划 PD 分离集群的 GPU 配比与网络带宽需求
- 教学或论文复现中模拟异构推理基础设施行为
替代项目
vLLM、SGLang
项目介绍
上一篇:llm-checker
下一篇:llm-d-router
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···