
vidur
不买 GPU,也能预演大模型推理性能与容量
Vidur 是微软开源的 LLM 推理系统模拟器,用于在无需真实 GPU 集群的情况下,大规模、精确地评估大模型推理服务的性能表现。它通过建模算子级计算、显存占用、批处理调度、KV Cache 管理以及张量/流水线并行等细节,复现 vLLM 等真实推理引擎的行为,从而预测吞吐、延迟、显存瓶颈与 SLO 达成情况。相比直接跑真实负载,Vidur 能在单机上快速扫描模型规模、硬件配置、并行策略、请求分布等大量组合,帮助研究者和工程师在部署前做容量规划、调度算法对比与架构选型,降低试错成本。项目基于 Python,模块化设计便于扩展新的模型、硬件与调度策略,适合作为 LLM 推理系统研究的实验平台。
开源
free
基础设施
GitHub 星标
★ 678
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类基础设施
开发团队microsoft
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型inference,llm,simulation,transformer,vllm
GitHub 星标★ 678
30天Star增速
HF 下载量
上线时间2023-11-02 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 算子级建模精度高,能复现 vLLM 等真实引擎的吞吐与延迟趋势
- 支持大规模配置扫描,单机即可评估多种模型、硬件与并行策略组合
- 模块化架构,便于扩展新模型、调度算法与硬件参数
不足之处
- 模拟结果仍依赖底层性能剖析数据,跨硬件迁移需重新校准
- 项目处于早期阶段,生态与文档完善度有待提升
适用场景
- 部署前做 GPU 容量规划与 SLO 评估
- 对比不同批处理/调度策略对推理吞吐的影响
- 研究新型并行方案或 KV Cache 管理算法
替代项目
vLLM、TensorRT-LLM
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···