LLMServingSim

不买卡也能仿真 LLM 推理集群的吞吐与延迟

LLMServingSim 2.0 是一个面向大语言模型(LLM)推理服务基础设施的仿真器,专为异构硬件与分离式(disaggregated)部署场景设计。它解决的核心问题是:在真实集群上评估 LLM 服务系统(如调度策略、并行方案、PD 分离架构)成本高、周期长、难以复现。该工具通过建模 GPU/加速器、内存、网络带宽与延迟,模拟请求在 prefill 与 decode 阶段的执行与调度过程,从而在不依赖真实硬件的情况下预测吞吐、延迟与资源利用率。它支持异构设备组合与分离式架构,便于研究人员快速对比不同系统设计,降低实验门槛,并为生产部署提供容量规划参考。

开源 unknown 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 402
维护状态 较活跃
是否开源
定价模式 unknown

项目数据

分类基础设施
开发团队casys-kaist
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 402
30天Star增速
HF 下载量
上线时间2024-07-23 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 支持异构硬件与 PD 分离架构建模,贴近真实生产部署形态
  • 纯 Python 实现,便于研究人员修改调度策略与并行方案
  • 可在无 GPU 环境下评估系统设计,降低实验成本与门槛

不足之处

  • 仿真精度依赖建模假设,与真实硬件行为可能存在偏差
  • 项目星标仅 400,生态与文档成熟度相对有限

适用场景

  • 研究新型 LLM 服务调度算法时快速对比吞吐与延迟
  • 规划 PD 分离集群的 GPU 配比与网络带宽需求
  • 教学或论文复现中模拟异构推理基础设施行为

替代项目

vLLM、SGLang

项目介绍

LLMServingSim 是一个基础设施领域的开源项目,官方简介:LLMServingSim 2.0: A Unified Simulator for Heterogeneous and Disaggregated LLM Serving Infrastructure。项目使用 Python 开发,在 GitHub 上获得 400 星标。

上一篇:llm-checker

下一篇:llm-d-router

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09