gpu-hot

打开网页,实时盯紧每一块 NVIDIA GPU 的状态

gpu-hot 是一个基于 JavaScript 开发的实时 NVIDIA GPU 监控仪表盘,以网页形式直观展示 GPU 的实时状态。它解决的是开发者和运维人员在多卡环境下难以快速掌握 GPU 利用率、显存占用、温度等关键指标的问题。核心能力包括:通过轻量级后端采集 NVIDIA GPU 数据,前端以动态图表和仪表盘形式呈现,支持多 GPU 节点同时监控,并具备历史数据趋势展示。项目部署简单,无需复杂配置,适合本地或内网环境快速启动,帮助用户实时洞察 GPU 资源使用情况,及时定位性能瓶颈或异常过热。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1634
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队psalias2006
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源
开源协议MIT
主要语言JavaScript
技术栈/模型charts,cuda,dashboard,devops,docker,flask,gpu,gpu-monitoring,llm,mlops,nvidia,nvidia-docker,nvidia-smi,python,real-time,real-time-monitoring,system-monitoring
GitHub 星标★ 1634
30天Star增速
HF 下载量
上线时间2025-10-05 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:Docker 6 步

环境要求

  • Docker 已安装并可用
  • 已安装 NVIDIA Container Toolkit(用于 --gpus all 透传显卡)
  • 主机已安装可用的 NVIDIA 显卡驱动(nvidia-smi 可正常输出)
  • 内网或本机可访问 1312 端口

安装与启动步骤

  1. 1准备运行环境

    先在宿主机确认 Docker 可用,并按官方指南安装 NVIDIA Container Toolkit,否则 docker run 加 --gpus all 会失败。

    docker --version
  2. 2单机启动监控

    一条命令拉起容器,映射 1312 端口并透传所有 GPU,后台常驻运行。

    docker run -d --gpus all -p 1312:1312 ghcr.io/psalias2006/gpu-hot:latest
  3. 3打开仪表盘

    浏览器访问本机 1312 端口即可看到实时 GPU 利用率、显存、温度等图表。

  4. 4多机节点上报

    在每个 GPU 服务器上运行同名镜像,并用 NODE_NAME 给节点起一个可辨识的名字。

    docker run -d --gpus all -p 1312:1312 -e NODE_NAME=$(hostname) ghcr.io/psalias2006/gpu-hot:latest
  5. 5启动聚合 Hub

    在一台无需 GPU 的机器上以 hub 模式启动,通过 NODE_URLS 用逗号分隔各节点地址。

    docker run -d -p 1312:1312 -e GPU_HOT_MODE=hub -e NODE_URLS=http://server1:1312,http://server2:1312,http://server3:1312 ghcr.io/psalias2006/gpu-hot:latest
  6. 6源码方式构建

    克隆仓库后进入目录,用 docker-compose 构建并启动,适合需要改代码的场景。

    git clone https://github.com/psalias2006/gpu-hot
    cd gpu-hot
    docker-compose up --build

关键配置

配置项必填说明示例
NVIDIA_VISIBLE_DEVICES指定要监控的 GPU 编号,默认监控全部。0,1
NVIDIA_SMI老型号显卡指标缺失时,强制改用 nvidia-smi 采集。true
GPU_HOT_MODE设为 hub 时启用多节点聚合,默认单节点模式。hub
NODE_NAME节点在仪表盘上的显示名,默认取主机名。gpu-server-1
NODE_URLShub 模式下必填,多个节点地址用逗号分隔。http://server1:1312,http://server2:1312
UPDATE_INTERVALNVML 轮询间隔(秒),默认 0.5。0.5

如何确认成功

浏览器打开 http://localhost:1312,能看到实时 GPU 利用率、温度等图表并持续刷新即成功。

常见问题

Q:页面上没有出现任何 GPU 指标怎么办?

A:多为老型号显卡 NVML 支持不佳,按 README 在启动命令中追加 -e NVIDIA_SMI=true 强制走 nvidia-smi 采集,然后重启容器。

Q:看不到具体的进程名和占用?

A:需要在 docker run 中追加 --init --pid=host 参数,容器才能读取宿主机进程信息,注意这会暴露宿主进程。

Q:hub 模式的那台机器需要显卡吗?

A:不需要。README 明确说明 hub 机器无需 GPU,只要各节点 URL 可达、端口已映射即可聚合展示。

Q:1312 端口被占用怎么处理?

A:改映射宿主机端口,例如 -p 1313:1312,容器内部端口仍保持 1312,然后访问 http://localhost:1313。

注意事项

  • --init --pid=host 会让容器访问宿主机进程信息,仅在可信内网环境使用。
  • 所有 GPU 服务器必须能通过 NODE_URLS 中填写的地址与端口互相访问。
  • README 未提及鉴权机制,建议不要直接暴露到公网。
  • 无客户端连接时轮询会自动暂停,空闲 CPU 占用接近零,属正常现象。

核心亮点

  • 实时刷新 GPU 利用率、显存、温度等核心指标,无需命令行
  • 支持多 GPU 节点集中监控,一屏掌握集群状态
  • 部署极简,一条命令启动本地 Web 服务,零依赖配置

不足之处

  • 仅支持 NVIDIA GPU,AMD 或其他加速卡无法使用
  • 功能聚焦监控展示,缺少告警通知和权限管理等进阶特性

适用场景

  • 深度学习训练时实时监控多卡利用率,避免资源闲置
  • GPU 服务器运维巡检,快速定位过热或显存溢出的显卡
  • 内网环境搭建轻量级 GPU 资源看板,供团队共享查看

替代项目

nvidia-smi、nvtop、DCGM Exporter + Grafana

项目介绍

gpu-hot 是基础设施领域的开源项目,由 psalias2006 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,634)位列前 30%,在基础设施分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:深度学习训练时实时监控多卡利用率,避免资源闲置。同类可对比的替代方案包括 nvidia-smi、nvtop、DCGM Exporter + Grafana。

上一篇:paddler

下一篇:rwkv.cpp

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09