llmaz

在 K8s 上一键部署多种 LLM 推理服务

llmaz 是一个面向 Kubernetes 的大模型推理平台,目标是把 vLLM、SGLang、TGI、llama.cpp、Ollama 等主流推理引擎统一纳管到 K8s 之上。它解决的核心问题是:在集群里部署和运维 LLM 服务通常需要手写大量 Deployment、Service、HPA 和模型加载逻辑,不同引擎的配置方式又各不相同。llmaz 通过自定义资源(CRD)声明式地描述模型来源、推理后端、副本数与资源规格,由控制器自动完成调度、模型拉取和服务暴露。它支持 HuggingFace、ModelScope 等模型仓库,也兼容多种推理运行时,并提供多模型共存、按需扩缩容等能力,让团队用一套 K8s 原生工作流管理多种 LLM 服务,降低运维复杂度。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 315
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队InftyAI
所属国家
定价模式free
价格说明开源免费,需自行部署在Kubernetes集群
访问状态
是否开源
开源协议Apache-2.0
主要语言Go
技术栈/模型huggingface,inference,inference-platform,kubernetes,llamacpp,llm,modelscope,ollama,sglang,text-generation-inference,vllm
GitHub 星标★ 315
30天Star增速
HF 下载量
上线时间2023-11-20 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 用 CRD 声明式管理模型与推理后端,避免手写大量 K8s 编排文件
  • 同时支持 vLLM、SGLang、TGI、llama.cpp、Ollama 等多种引擎,切换成本低
  • 原生对接 HuggingFace 与 ModelScope 模型仓库,模型拉取和缓存自动化

不足之处

  • 项目处于早期阶段,Star 数较少,生产环境验证案例有限
  • 文档与社区生态相对薄弱,遇到问题可参考的资料不多

适用场景

  • 团队已有 K8s 集群,想统一部署多个开源大模型推理服务
  • 需要在同一集群内按业务切换 vLLM、SGLang 等不同推理后端
  • 希望用声明式配置替代手写 Deployment 来管理模型上线与扩缩容

替代项目

KServe、Ray Serve、vLLM Production Stack

项目介绍

llmaz 是一个基础设施领域的开源项目,官方简介:☸️ Easy, advanced inference platform for large language models on Kubernetes. Star to support our work!。项目使用 Go 开发,在 GitHub 上获得 314 星标。

上一篇:chats

下一篇:ollama-operator

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09