vidur

不买 GPU,也能预演大模型推理性能与容量

Vidur 是微软开源的 LLM 推理系统模拟器,用于在无需真实 GPU 集群的情况下,大规模、精确地评估大模型推理服务的性能表现。它通过建模算子级计算、显存占用、批处理调度、KV Cache 管理以及张量/流水线并行等细节,复现 vLLM 等真实推理引擎的行为,从而预测吞吐、延迟、显存瓶颈与 SLO 达成情况。相比直接跑真实负载,Vidur 能在单机上快速扫描模型规模、硬件配置、并行策略、请求分布等大量组合,帮助研究者和工程师在部署前做容量规划、调度算法对比与架构选型,降低试错成本。项目基于 Python,模块化设计便于扩展新的模型、硬件与调度策略,适合作为 LLM 推理系统研究的实验平台。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 678
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队microsoft
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型inference,llm,simulation,transformer,vllm
GitHub 星标★ 678
30天Star增速
HF 下载量
上线时间2023-11-02 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 算子级建模精度高,能复现 vLLM 等真实引擎的吞吐与延迟趋势
  • 支持大规模配置扫描,单机即可评估多种模型、硬件与并行策略组合
  • 模块化架构,便于扩展新模型、调度算法与硬件参数

不足之处

  • 模拟结果仍依赖底层性能剖析数据,跨硬件迁移需重新校准
  • 项目处于早期阶段,生态与文档完善度有待提升

适用场景

  • 部署前做 GPU 容量规划与 SLO 评估
  • 对比不同批处理/调度策略对推理吞吐的影响
  • 研究新型并行方案或 KV Cache 管理算法

替代项目

vLLM、TensorRT-LLM

项目介绍

vidur 是一个基础设施领域的开源项目,官方简介:Accurate, large-scale, and extensible simulator for LLM inference Systems。项目使用 Python 开发,在 GitHub 上获得 677 星标。

上一篇:pegainfer

下一篇:dify-helm

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09