
llmaz
在 K8s 上一键部署多种 LLM 推理服务
llmaz 是一个面向 Kubernetes 的大模型推理平台,目标是把 vLLM、SGLang、TGI、llama.cpp、Ollama 等主流推理引擎统一纳管到 K8s 之上。它解决的核心问题是:在集群里部署和运维 LLM 服务通常需要手写大量 Deployment、Service、HPA 和模型加载逻辑,不同引擎的配置方式又各不相同。llmaz 通过自定义资源(CRD)声明式地描述模型来源、推理后端、副本数与资源规格,由控制器自动完成调度、模型拉取和服务暴露。它支持 HuggingFace、ModelScope 等模型仓库,也兼容多种推理运行时,并提供多模型共存、按需扩缩容等能力,让团队用一套 K8s 原生工作流管理多种 LLM 服务,降低运维复杂度。
项目数据
使用教程
核心亮点
- 用 CRD 声明式管理模型与推理后端,避免手写大量 K8s 编排文件
- 同时支持 vLLM、SGLang、TGI、llama.cpp、Ollama 等多种引擎,切换成本低
- 原生对接 HuggingFace 与 ModelScope 模型仓库,模型拉取和缓存自动化
不足之处
- 项目处于早期阶段,Star 数较少,生产环境验证案例有限
- 文档与社区生态相对薄弱,遇到问题可参考的资料不多
适用场景
- 团队已有 K8s 集群,想统一部署多个开源大模型推理服务
- 需要在同一集群内按业务切换 vLLM、SGLang 等不同推理后端
- 希望用声明式配置替代手写 Deployment 来管理模型上线与扩缩容
替代项目
KServe、Ray Serve、vLLM Production Stack
项目介绍
上一篇:chats
下一篇:ollama-operator
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···