kserve

在 Kubernetes 上标准化部署 AI 模型,一键搞定推理服务

KServe 是一个基于 Kubernetes 的标准化的分布式生成式 AI 和预测式 AI 推理平台,旨在为可扩展、多框架的模型部署提供统一解决方案。它解决了在 Kubernetes 上部署和管理多种机器学习模型(如 TensorFlow、PyTorch、XGBoost 以及大语言模型)时面临的复杂性、异构性和扩展性问题。其核心能力包括:提供一致的推理接口(支持 REST 和 gRPC)、自动缩放(基于 Knative)、服务网格集成(通过 Istio)、模型版本管理、金丝雀发布、以及针对生成式 AI 的专用支持(如 vLLM、Triton 等推理服务器)。KServe 由 CNCF 孵化,与 Kubeflow 生态紧密集成,支持从模型训练到线上服务的无缝衔接,帮助团队以标准化方式快速部署和运维 AI 服务。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5988
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队kserve
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Go
技术栈/模型artificial-intelligence,cncf,genai,hacktoberfest,istio,k8s,knative,kserve,kubeflow,kubernetes,llm-inference,machine-learning,mlops,model-interpretability,model-serving,pytorch,service-mesh,tensorflow,vllm,xgboost
GitHub 星标★ 5988
30天Star增速
HF 下载量
上线时间2019-03-27 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 一个可用的 Kubernetes 集群(KServe 是部署在 Kubernetes 上的推理平台)
  • kubectl 命令行工具,用于在集群上执行安装与查看资源
  • 如需 Serverless 部署(缩容到零、金丝雀发布),集群需支持 Knative(KServe 默认安装 Knative)
  • 如需大规模、高频变更的模型服务场景,可选装 ModelMesh
  • 生成式 AI 场景建议准备支持 GPU 的节点,以获得高性能推理与显存优化

安装与启动步骤

  1. 1准备 Kubernetes 集群

    README 明确 KServe 是运行在 Kubernetes 上的推理平台,因此第一步需先具备可访问的集群并确保 kubectl 能正常连接。

  2. 2选择安装方式

    README 给出四种选择:标准 Kubernetes(轻量、不支持金丝雀与缩容到零)、Knative、ModelMesh、以及本地机器快速安装。

  3. 3按官方文档执行安装

    README 未给出具体安装命令,只链接到官网 admin-guide 的对应章节,请打开链接按所选方式操作。

  4. 4本地快速试用

    若想在本地机器上先跑起来,README 推荐使用 Quick Installation,对应官网 getting-started 的快速开始指南。

  5. 5Kubeflow 环境安装

    若集群已运行 Kubeflow,KServe 是其重要附加组件,可参考 Kubeflow 官方 KServe 文档,或 AWS、OpenShift 专用指南。

  6. 6部署推理服务

    安装完成后即可部署模型:生成式 AI 可选用 vLLM 等优化后端并直接使用 Hugging Face 模型,预测式 AI 支持多框架。

如何确认成功

README 未提供验证命令,请按官网 Quickstart 指南检查 InferenceService 是否创建成功并进入就绪状态。

常见问题

Q:标准 Kubernetes 安装和 Knative 安装有什么区别?

A:标准 Kubernetes 更轻量,但不支持金丝雀发布和基于请求的自动缩放到零;Knative 安装支持 Serverless 部署,具备缩容到零和请求驱动自动扩缩能力。

Q:什么情况下需要安装 ModelMesh?

A:当你需要高扩展性、高密度、模型频繁变更的服务场景时可选择性安装 ModelMesh。

Q:KServe 支持哪些模型框架?

A:预测式 AI 支持多框架(如 TensorFlow、PyTorch、XGBoost 等);生成式 AI 支持 vLLM、llm-d 等优化后端,并原生支持 Hugging Face 模型。

Q:生成式 AI 推理有什么特别能力?

A:提供 OpenAI 兼容推理协议、GPU 加速与显存优化、模型缓存、KV 缓存卸载到 CPU/磁盘、以及面向生成式负载的请求级自动扩缩。

Q:可以用在 Kubeflow 里吗?

A:可以。KServe 是 Kubeflow 的重要附加组件,README 提供了通用文档以及 AWS、OpenShift 环境下的部署指南。

注意事项

  • README 中没有给出任何可直接复制的安装命令,全部安装步骤都指向 KServe 官网文档,请以官网为准。
  • 本教程的命令字段留空是刻意的:与其编造命令,不如按 README 指引打开对应链接操作。
  • serverless、缩容到零、金丝雀发布依赖 Knative;不需要这些能力时可选更轻量的标准 Kubernetes 安装。
  • KServe 是 CNCF 孵化项目,已在众多组织中使用,生产部署前建议先阅读官网 admin-guide 的完整要求。

核心亮点

  • 支持 TensorFlow、PyTorch、XGBoost 及 LLM 等多种框架,统一推理接口
  • 基于 Knative 实现自动缩放,流量高峰时弹性扩容,节省成本
  • 内置金丝雀发布和模型版本管理,便于安全上线新模型

不足之处

  • 配置和调试门槛较高,需要熟悉 Kubernetes 和 Istio 生态
  • 文档/社区待观察

适用场景

  • 企业级 AI 平台建设,统一管理多种模型的线上推理服务
  • 大规模 LLM 服务部署,需要自动缩放和高并发支持
  • 与 Kubeflow 配合,实现从训练到部署的 MLOps 全流程

替代项目

Seldon Core、BentoML、Ray Serve

项目介绍

kserve 是基础设施领域的开源项目,由 kserve 开发,2019 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(5,988)位列前 8%,在基础设施分类的 1,132 个项目里位列前 12%。

近 41 天,它的 GitHub 星标从 5,784 增加到 5,988,净增 204。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可免费使用和部署,无付费版本。

它主要面向的使用场景是:企业级AI平台建设,统一管理多种模型的线上推理服务。同类可对比的替代方案包括 Seldon Core、BentoML、Ray Serve。

上一篇:lance

下一篇:LongLive

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09