
llm-d-router
让 K8s 推理入口按负载智能分发请求,降低排队与延迟
llm-d-router 是 llm-d 项目中的智能推理入口组件,用 Go 编写,基于 Kubernetes Gateway API 构建。它解决的是大模型推理服务在生产环境中的流量调度难题:当多个模型副本、多种推理后端(如 vLLM、TGI)同时运行时,普通网关无法感知 KV 缓存、队列深度和模型负载,容易造成请求排队、GPU 利用率不均和首 token 延迟升高。llm-d-router 在网关层引入推理感知的路由能力,结合 Gateway API 的标准化扩展点,把请求分发到最合适的推理实例上,并支持按模型、LoRA 适配器、会话亲和等维度做流量切分。它面向在 Kubernetes 上自建推理集群的团队,目标是让推理入口具备可观测、可扩展、可编排的能力,而不是简单轮询转发。
项目数据
使用教程
核心亮点
- 基于 Kubernetes Gateway API 标准扩展,不绑定私有网关实现,便于融入现有集群
- 路由决策考虑推理特性(如 KV 缓存、队列深度),而非简单轮询,有助于降低首 token 延迟
- Go 编写,天然适合云原生部署,与 llm-d 生态的推理编排组件协同工作
不足之处
- 项目处于早期阶段,星标数较少,生产环境验证案例有限
- 依赖 Gateway API 及推理后端的特定能力,配置和运维门槛较高
适用场景
- 在 Kubernetes 上部署多副本 vLLM 推理服务,需要按负载均衡请求
- 为多个模型或 LoRA 适配器提供统一推理入口并按模型分流
- 对延迟敏感的在线推理业务,需要减少请求排队和 GPU 空转
替代项目
KServe、vLLM production stack
项目介绍
上一篇:LLMServingSim
下一篇:flashinfer
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···