nvidia_gpu_exporter

一条命令把 NVIDIA GPU 监控接入 Prometheus,实时掌握显卡状态。

nvidia_gpu_exporter 是一个用 Go 编写的 Prometheus 导出器,通过调用 nvidia-smi 二进制文件采集 NVIDIA GPU 的实时监控指标,并以 Prometheus 标准格式暴露给抓取。它解决了 Kubernetes 或裸机环境中 GPU 资源缺乏统一可观测性的问题,让运维人员能通过 Prometheus 和 Grafana 直观监控 GPU 利用率、显存占用、温度、功耗、风扇转速等关键数据。核心能力包括:支持多 GPU 卡自动发现与标签区分、提供丰富的指标集(如利用率、显存使用、温度、功耗、PCIe 带宽等)、支持自定义采集频率和指标过滤、轻量级部署(单一二进制文件)以及兼容 Prometheus 生态。项目基于 nvidia-smi,无需额外驱动或特权容器,配置简单,适合快速集成到现有监控体系。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1557
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队utkuozdemir
所属国家
官网地址
定价模式free
价格说明开源项目,MIT 许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Go
技术栈/模型ai,cryptocurrency,gaming,inference,llm,llm-training,monitoring,nvidia,nvidia-gpu,nvidia-smi,nvml,prometheus,prometheus-exporter
GitHub 星标★ 1557
30天Star增速
HF 下载量
上线时间2021-06-08 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数8

使用教程

难度:入门 约 10 分钟 部署方式:Docker 5 步

环境要求

  • Linux 机器(README 快速开始针对 Linux)
  • 已安装 NVIDIA 驱动
  • 已安装 NVIDIA Container Toolkit
  • 可访问 Docker Hub 或 GHCR 拉取镜像

安装与启动步骤

  1. 1确认前置环境

    在一台已装 NVIDIA 驱动和 NVIDIA Container Toolkit 的 Linux 机器上操作,否则容器无法识别 GPU。

  2. 2启动导出器容器

    后台运行官方镜像,暴露 9835 端口,并把 GPU 与工具能力传给容器,重启策略为 unless-stopped。

    docker run -d --name nvidia_gpu_exporter --restart unless-stopped --gpus all -e NVIDIA_DRIVER_CAPABILITIES=utility -p 9835:9835 utkuozdemir/nvidia_gpu_exporter:latest
  3. 3验证指标输出

    请求本地 9835 端口的 /metrics,看到 Prometheus 文本格式的 GPU 指标说明采集成功。

    curl http://localhost:9835/metrics
  4. 4无 GPU 时用演示后端

    手头没有 GPU 可用 demo 后端输出合成的真实感指标,便于先打通 Prometheus 链路。

    nvidia_gpu_exporter --collect.backend demo
  5. 5按平台补充安装

    Windows、macOS、Kubernetes、deb/rpm 包或裸机二进制安装,均按官方 INSTALL.md 与 Helm chart 操作。

关键配置

配置项必填说明示例
-p 9835:9835是映射容器端口,Prometheus 从该端口抓取指标9835:9835
NVIDIA_DRIVER_CAPABILITIES是授予容器使用 nvidia-smi 所需的驱动能力utility
--gpus all是把宿主机全部 GPU 暴露给容器all

如何确认成功

执行 curl http://localhost:9835/metrics,返回 Prometheus 文本格式的 GPU 指标即启动成功。

常见问题

Q:没有 NVIDIA GPU 能跑起来吗?

A:可以。使用 --collect.backend demo 启动,会在任意机器上输出合成的仿真指标,方便先验证采集链路。

Q:Windows 或 macOS 怎么安装?

A:官方 INSTALL.md 覆盖各平台:Windows 支持 winget、Scoop、原生服务或一键脚本,macOS 也有对应说明,无需 Docker。

Q:容器启动后抓不到 GPU 指标怎么办?

A:先确认宿主机已装 NVIDIA 驱动与 NVIDIA Container Toolkit,并且运行容器时带了 --gpus all 和 NVIDIA_DRIVER_CAPABILITIES=utility。

Q:如何调整采集行为或过滤指标?

A:具体配置项见官方 CONFIGURE.md 文档,README 未列全部参数,请以该文档为准。

注意事项

  • README 明确说明这是作者业余维护的 side project,issue 和 PR 可能响应很慢。
  • 除 Docker 外还支持裸机二进制、deb/rpm 包、Kubernetes Helm chart、Windows 与 macOS,详见 docs/INSTALL.md。
  • 容器镜像同时发布在 Docker Hub 与 GHCR,Helm chart 发布在 Artifact Hub,二进制包在 releases 页面。

核心亮点

  • 直接调用 nvidia-smi,无需安装额外驱动或复杂权限,部署简单
  • 指标覆盖全面,包括利用率、显存、温度、功耗、风扇等关键项
  • 支持多 GPU 自动发现,并通过标签区分不同设备,便于集群监控

不足之处

  • 依赖 nvidia-smi 输出解析,性能开销随 GPU 数量增加而上升
  • 文档/社区待观察

适用场景

  • Kubernetes 集群中监控 GPU 节点资源使用情况
  • 深度学习训练任务中实时跟踪 GPU 温度和功耗,防止过热
  • 多机多卡环境下统一收集 GPU 指标用于容量规划和成本分析

替代项目

dcgm-exporter、nvidia_gpu_exporter (Prometheus 官方)、gpu-monitoring-tools

项目介绍

nvidia_gpu_exporter 是基础设施领域的开源项目,由 utkuozdemir 开发,2021 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,557)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,527 增加到 1,557,净增 30。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。MIT 许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:Kubernetes集群中监控GPU节点资源使用情况。同类可对比的替代方案包括 dcgm-exporter、nvidia_gpu_exporter (Prometheus 官方)、gpu-monitoring-tools。

上一篇:rwkv.cpp

下一篇:llmgateway

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09