
llm-d-inference-sim
不装 GPU 不跑模型,秒起一个假 vLLM 服务
llm-d-inference-sim 是一个用 Go 编写的轻量级推理模拟器,目标是复刻 vLLM 的对外行为,让开发者无需 GPU、无需加载真实大模型,就能在本地或 CI 环境跑通推理链路。它对外暴露与 vLLM 兼容的 HTTP 接口,支持配置模型名、并发数、吞吐延迟、流式输出等参数,并按设定的时序返回模拟的 token 流。核心价值在于把「依赖重型硬件和真实权重」的推理服务替换成可脚本化、可复现的假服务,用于压测客户端、验证网关与路由、调试流式协议、测试超时与重试逻辑,以及在 Kubernetes/llm-d 这类编排环境中做端到端联调。项目处于孵化阶段,代码量小、启动快,适合作为推理基础设施的测试替身。
开源
free
基础设施
GitHub 星标
★ 199
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类基础设施
开发团队llm-d
所属国家
定价模式free
价格说明开源免费,无需GPU即可模拟vLLM推理
访问状态
是否开源是
开源协议Apache-2.0
主要语言Go
技术栈/模型incubating
GitHub 星标★ 199
30天Star增速
HF 下载量
上线时间2025-04-09 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 纯 Go 实现,单二进制启动,无需 GPU 和模型权重,CI 里也能跑
- 对外接口对齐 vLLM,客户端和网关代码不用改就能切换测试
- 可配置延迟、并发、流式输出等行为,方便复现超时、重试、限流等边界场景
不足之处
- 仅模拟行为,不产生真实 token 质量,无法用于效果评估
- 项目处于孵化早期,星标少,接口覆盖面和长期维护待观察
适用场景
- 在 CI 中压测推理网关、路由和负载均衡逻辑
- 本地开发调试流式 SSE 协议、超时与重试策略
- 在 Kubernetes/llm-d 环境中做端到端联调,替代真实推理后端
替代项目
vLLM、TGI、Ollama
项目介绍
上一篇:clewdr
下一篇:llm-on-openshift
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···