llm-d

在 Kubernetes 上榨干 GPU,让 LLM 推理飞起来

llm-d 是一个专注于在 Kubernetes 上实现现代加速器(如 GPU)上最先进推理性能的开源项目。它解决了在云原生环境中部署大型语言模型时面临的性能瓶颈和资源调度复杂性问题。通过利用 Kubernetes 的编排能力,llm-d 提供了优化的推理引擎和运行时,能够自动适配不同的硬件加速器,实现高效的模型加载、批处理和推理加速。其核心能力包括动态资源分配、模型并行策略优化、以及针对特定硬件(如 NVIDIA A100/H100)的底层内核调优,从而显著降低推理延迟并提升吞吐量。项目采用 Shell 脚本作为主要语言,通过简洁的部署流程和配置管理,使得用户能够在 Kubernetes 集群上快速部署并运行高性能的 LLM 推理服务。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4624
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队llm-d
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自由使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Shell
技术栈/模型ai,cncf,distributed-inference,gpu,inference,intelligent-routing,kubernetes,llm,model-server
GitHub 星标★ 4624
30天Star增速
HF 下载量
上线时间2025-04-29 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:高级 约 30 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可用的 Kubernetes 集群及集群访问权限(llm-d 面向 Kubernetes 生产部署)
  • GPU 等硬件加速器节点(适配多数加速器,如 NVIDIA A100/H100)
  • 已部署的模型服务器运行时:vLLM 或 SGLang
  • 能访问互联网以获取 llm-d 仓库与官方文档

安装与启动步骤

  1. 1准备 Kubernetes 集群

    llm-d 是运行在 Kubernetes 之上的分布式推理服务栈,部署前需先具备可用集群与访问权限;README 未给出具体版本要求。

  2. 2准备加速器资源

    确认集群节点具备 GPU 等加速器,llm-d 目标是在各类加速器上达到 SOTA 推理性能。

  3. 3获取 llm-d 仓库

    从 GitHub 克隆 llm-d 项目,后续按仓库内脚本与官方指南进行部署;README 未列出具体安装命令。

    git clone https://github.com/llm-d/llm-d.git
  4. 4选择模型服务器

    先确定底层模型服务器为 vLLM 或 SGLang,llm-d 在其之上提供编排与优化能力。

  5. 5查阅官方部署指南

    README 仅给出方向性说明,实际部署请以官网文档中的 Well-Lit Paths 指南为准,如优化基线路径。

如何确认成功

README 未提供启动验证方法,请以 llm-d 官网文档对应指南中的健康检查与基准测试结果为准。

常见问题

Q:llm-d 和 vLLM、SGLang 是什么关系?

A:vLLM、SGLang 等模型服务器负责在加速器上高效运行大模型,llm-d 在其之上提供编排与优化,面向高并发真实流量。

Q:llm-d 一定要用 Kubernetes 吗?

A:是。README 明确说明 llm-d 是面向 Kubernetes 生产部署的高性能分布式推理服务栈。

Q:需要 GPU 吗?

A:需要。llm-d 的目标是在各类硬件加速器上实现 SOTA 推理性能,并针对特定硬件做内核调优。

Q:项目由谁维护?

A:llm-d 是 CNCF 沙箱项目,由 Red Hat、Google Cloud、IBM Research、CoreWeave 和 NVIDIA 共同创立。

Q:README 里有安装命令吗?

A:本项目 README 节选以特性介绍为主,未给出安装命令,请转到官网文档中的部署指南查看完整步骤。

注意事项

  • README 节选未包含任何安装命令,本教程中的步骤为基础准备动作,实际部署请以 https://www.llm-d.ai 官方文档为准。
  • 项目主要使用 Shell 脚本编写,部署流程依赖 Kubernetes 与加速器环境,建议具备一定云原生运维经验。
  • llm-d 提供智能路由(前缀缓存、负载感知均衡)和分层 KV-Cache 管理等能力,可按需在官方指南中选择对应路径。

核心亮点

  • 深度优化现代加速器(如 H100)的内核,推理性能达到 SOTA
  • 与 Kubernetes 原生集成,简化 GPU 资源调度和弹性伸缩
  • 支持动态批处理和模型并行,提升吞吐量并降低延迟

不足之处

  • 文档/社区待观察
  • 主要依赖 Shell 脚本,复杂配置可能不够灵活

适用场景

  • 在 Kubernetes 集群上部署高吞吐量的 LLM 推理服务
  • 需要最大化 GPU 利用率、降低推理成本的生产环境
  • 大规模模型(如 70B+)的分布式推理和并行优化

替代项目

vLLM、Triton Inference Server、Ray Serve

项目介绍

llm-d 是基础设施领域的开源项目,由 llm-d 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,624)位列前 10%,在基础设施分类的 1,132 个项目里位列前 14%。

近 41 天,它的 GitHub 星标从 4,024 增加到 4,624,净增 600。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可自由使用和部署,无付费版本。

它主要面向的使用场景是:在Kubernetes集群上部署高吞吐量的LLM推理服务。同类可对比的替代方案包括 vLLM、Triton Inference Server、Ray Serve。

上一篇:csghub

下一篇:kimi-k3-in-c

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09