kubeai

在 K8s 上声明式部署大模型,自动扩缩容,开箱即用 OpenAI 接口

KubeAI 是一个面向 Kubernetes 的 AI 推理 Operator,目标是把大模型、视觉语言模型、Embedding 和语音转文字等模型在生产环境中部署这件事变得像声明式配置一样简单。它通过自定义资源(CRD)定义模型,自动拉起 vLLM、Ollama、Faster Whisper 等推理后端,并暴露兼容 OpenAI API 的接口,业务侧无需改代码即可切换模型。核心能力包括:按模型声明式部署、基于请求量的自动扩缩容(含缩到零)、多后端统一调度、GPU 资源管理,以及通过标准 API 接入现有应用。它解决的是自建推理服务时环境搭建繁琐、扩缩容靠手工、多模型多框架难以统一管理的问题,适合已有 K8s 集群、希望把模型服务纳入现有运维体系的团队。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1263
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队kubeai-project
所属国家
定价模式free
价格说明开源免费,Apache-2.0许可证
访问状态
是否开源
开源协议Apache-2.0
主要语言Go
技术栈/模型ai,autoscaler,faster-whisper,inference-operator,k8s,kubernetes,llm,ollama,ollama-operator,openai-api,vllm,vllm-operator,whisper
GitHub 星标★ 1263
30天Star增速
HF 下载量
上线时间2023-10-21 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-17
浏览次数0

使用教程

难度:进阶 约 15 分钟 部署方式:本地安装 3 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 本地 Kubernetes 集群(kind 或 minikube)
  • 若使用 Podman 运行 kind,Podman machine 内存上限需提到 6G
  • 硬件可为 CPU、GPU 或 TPU
  • 无需 Istio、Knative 等额外依赖

安装与启动步骤

  1. 1创建本地集群

    用 kind 或 minikube 搭建本地 Kubernetes 集群,作为安装 KubeAI 的基础环境。

  2. 2Podman 调内存

    若用 Podman 跑 kind,需把 Podman machine 内存上限从默认 2G 提升到 6G,否则可能资源不足。

  3. 3参考官方 quickstart

    README 节选未给出完整安装命令,请按官网 Local Quickstart 文档继续安装。

如何确认成功

README 节选未给出启动验证方法,请以官网 quickstart 的输出为准。

常见问题

Q:必须要有 GPU 吗?

A:不需要。KubeAI 硬件灵活,可运行在 CPU、GPU 或 TPU 上。

Q:需要额外装 Istio 或 Knative 吗?

A:不需要。KubeAI 主打零依赖,不要求 Istio、Knative 等组件。

Q:本地用什么搭集群?

A:README 建议使用 kind 或 minikube 创建本地 Kubernetes 集群。

Q:业务代码要改吗?

A:不用。KubeAI 提供兼容 OpenAI 的 API,可直接用现有 OpenAI 客户端库调用。

注意事项

  • README 节选只包含 Local Quickstart 片段,未提供可复制的安装命令,完整步骤请查阅 https://www.kubeai.org 。
  • 使用 Podman 运行 kind 时务必先调整 Podman machine 内存,默认上限为 2G。
  • 该 Operator 面向 Kubernetes,本地体验需先具备可用的集群环境。

核心亮点

  • 用 CRD 声明模型即可部署,自动选择 vLLM/Ollama/Faster Whisper 等后端
  • 内置基于请求量的自动扩缩容,支持缩到零节省 GPU 成本
  • 统一暴露 OpenAI 兼容 API,业务代码无需改动即可切换模型

不足之处

  • 强依赖 Kubernetes 和 GPU 环境,无集群或纯 CPU 场景上手成本高
  • 项目处于成长阶段,生态和文档成熟度相比老牌方案仍有差距

适用场景

  • 已有 K8s 集群的团队自建 LLM 推理服务并对外提供 API
  • 需要按流量自动扩缩容、控制 GPU 成本的模型服务平台
  • 统一管理多种模型(对话、向量、语音)的 AI 基础设施层

替代项目

KServe、Ray Serve、vLLM

项目介绍

kubeai 是一个基础设施领域的开源项目,官方简介:AI Inference Operator for Kubernetes. The easiest way to serve ML models in production. Supports VLMs, LLMs, embeddings, and speech-to-text.。项目使用 Go 开发,在 GitHub 上获得 1263 星标。

上一篇:rapid_llm

下一篇:ComputeLibrary

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09