gpustack

一键管理 GPU 集群,轻松部署高性能 AI 模型服务

gpustack 是一个面向高性能 AI 模型服务的 GPU 集群管理器,专注于简化 vLLM、SGLang 等推理引擎的部署与运维。它解决了 GPU 资源利用率低、多模型管理复杂、环境配置繁琐等痛点,提供统一的集群视图,支持模型的一键部署、自动扩缩容、健康检查与滚动更新。同时,它还能按需创建可 SSH 访问的 GPU 实例,方便开发调试或临时任务。核心能力包括:多节点 GPU 资源池化、模型服务的高可用管理、基于 Web 的直观操作界面、以及灵活的调度策略。通过将基础设施细节抽象化,gpustack 让团队能更专注于模型本身,快速交付 AI 应用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5741
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队gpustack
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自行部署使用,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ascend,cuda,deepseek,distributed-inference,genai,high-performance-inference,inference,llama,llm,llm-inference,llm-serving,maas,mindie,openai,qwen,rocm,sglang,vllm
GitHub 星标★ 5741
30天Star增速
HF 下载量
上线时间2024-05-11 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:Docker 8 步

环境要求

  • 已安装 Docker(服务端与 worker 节点均需)
  • 具备 sudo/root 权限执行 docker 命令
  • GPU worker 节点需配置 nvidia 容器运行时(--runtime nvidia)
  • 服务端主机 80 端口可访问,worker 能访问服务端 URL
  • 浏览器用于访问 GPUStack Web UI

安装与启动步骤

  1. 1启动 GPUStack 服务

    用 Docker 启动服务端,映射 80 端口并挂载数据卷做持久化;命令需 sudo 权限执行。

    sudo docker run -d --name gpustack 
        --restart unless-stopped 
        -p 80:80 
        --volume gpustack-data:/var/lib/gpustack 
        gpustack/gpustack
  2. 2查看启动日志

    持续跟踪容器日志,确认服务正常启动,无拉取镜像失败、端口占用等报错。

    sudo docker logs -f gpustack
  3. 3获取管理员密码

    从容器内读取初始管理员密码文件,复制密码备用,登录用户名固定为 admin。

    sudo docker exec gpustack cat /var/lib/gpustack/initial_admin_password
  4. 4登录 Web 界面

    浏览器打开 http://your_host_ip,用 admin 和上一步获取的密码登录,进入 GPUStack 管理台。

  5. 5添加 GPU 集群

    在 Clusters 页点 Add Cluster,provider 选 Docker,填写 Name 与 Description 后点 Save。

  6. 6接入 Worker 节点

    按 UI 指引在 worker 节点执行生成的命令,替换 server 地址、token 与本机 IP;需 privileged 和 nvidia runtime。

    sudo docker run -d --name gpustack-worker 
          --restart=unless-stopped 
          --privileged 
          --network=host 
          --volume /var/run/docker.sock:/var/run/docker.sock 
          --volume gpustack-data:/var/lib/gpustack 
          --runtime nvidia 
          gpustack/gpustack 
          --server-url http://your_gpustack_server_url 
          --token your_worker_token 
          --advertise-address 192.168.1.2
  7. 7部署模型

    进入 Catalog 页选模型(如 Qwen3.5-0.8B),兼容性检查通过后点 Save,等待状态变为 Running。

  8. 8验证模型对话

    进入 Playground - Chat,确认右上角 Model 下拉选中已部署模型,直接对话测试推理效果。

关键配置

配置项必填说明示例
-p 80:80是将容器 80 端口映射到宿主机,用于浏览器访问 Web UI-p 80:80
--volume gpustack-data是挂载数据卷持久化配置与模型数据,避免容器重建丢失--volume gpustack-data:/var/lib/gpustack
--server-url是worker 节点连接的服务端地址,由 UI 生成后替换为实际地址http://your_gpustack_server_url
--token是worker 接入集群的认证令牌,由 UI 生成,需替换为实际值your_worker_token
--advertise-address是worker 对外通告的本机 IP,供服务端与其他节点访问192.168.1.2
--system-default-container-registry否改用 Quay 镜像源时指定默认容器仓库,缓解 Docker Hub 拉取慢quay.io

如何确认成功

docker logs 显示服务正常启动后,浏览器访问 http://your_host_ip,用 admin 与 initial_admin_password 登录成功即部署完成。

常见问题

Q:Docker Hub 拉取镜像很慢或失败怎么办?

A:改用 Quay.io 镜像:把镜像名换成 quay.io/gpustack/gpustack,并追加参数 --system-default-container-registry quay.io 重新运行容器。

Q:默认用户名和密码是什么?

A:用户名固定为 admin,密码通过 sudo docker exec gpustack cat /var/lib/gpustack/initial_admin_password 读取容器内文件获得。

Q:Worker 节点接入命令从哪里来?

A:在 UI 的 Clusters 页点 Add Cluster,选择 Docker 并保存后,按界面指引生成 worker 命令,再在 worker 节点执行。

Q:Worker 节点在 UI 上看不到?

A:确认 worker 节点已启用 nvidia runtime、--privileged 与 host 网络,且能访问 --server-url,token 与 advertise-address 填写正确。

注意事项

  • 服务端与 worker 均以 Docker 方式部署,README 未给出非 Docker 的本地安装方式
  • worker 节点必须带 --privileged、--network=host 并挂载 /var/run/docker.sock 才能正常纳管
  • 获取初始管理员密码需在服务启动后执行,登录后建议尽快修改默认密码
  • 示例中的 server 地址、token、IP 为占位值,实际执行时须替换为真实值

核心亮点

  • 原生集成 vLLM 和 SGLang,针对高性能推理优化,部署配置简单
  • 提供 Web UI 和 CLI,支持模型版本管理与滚动更新,运维效率高
  • 支持 GPU 实例的按需创建与 SSH 访问,兼顾开发调试与生产服务

不足之处

  • 项目较新,生态和文档成熟度待观察
  • 高级调度策略(如多租户、复杂亲和性)可能不如老牌集群管理器丰富

适用场景

  • 团队需要统一管理多台 GPU 服务器并部署多个 LLM 服务
  • 快速搭建 vLLM/SGLang 推理服务,并希望有自动扩缩容和健康检查
  • 为开发人员提供临时的 GPU 开发环境,支持 SSH 直连调试

替代项目

KubeRay、RunPod、Modal

项目介绍

gpustack 是基础设施领域的开源项目,由 gpustack 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(5,741)位列前 8%,在基础设施分类的 1,130 个项目里位列前 12%。

近 41 天,它的 GitHub 星标从 5,473 增加到 5,741,净增 268。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可自行部署使用,无付费版本。

它主要面向的使用场景是:团队需要统一管理多台GPU服务器并部署多个LLM服务。同类可对比的替代方案包括 KubeRay、RunPod、Modal。

上一篇:turbo-fieldfare

下一篇:deepreasoning

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09