Prometheus 显卡指标采集

0 阅读1分钟

说明

本文介绍如何采集服务器显卡相关的数据,以英伟达

安装扩展

Prometheus 采集到的数据都是通过安装扩展来实现的,采集英伟达显卡数据,需要安装下面这个扩展

下载地址:github.com/utkuozdemir…

选择对应的版本,我的是 CentOS 7,下载下面这个

在这里插入图片描述

上传到服务器上,解压,如下

在这里插入图片描述

创建一个 service 服务,将应用的启停用 systemctl 管理

vim /etc/systemd/system/nvidia_gpu_exporter.service

内容如下,注意路径,需更换成自己的

[Unit]
Description=nvidia_gpu_exporter
Documentation=https://github.com/NVIDIA/dcgm-exporter
After=network.target

[Service]
Type=simple
User=root
ExecStart=/usr/local/dev/prometheus/nvidia_gpu_exporter_1.15.1/nvidia_gpu_exporter
Restart=always
RestartSec=3
TimeoutStartSec=30
StandardOutput=journal+console
StandardError=journal+console

[Install]
WantedBy=multi-user.target

启动

敲下面的命令,重新加载系统服务

systemctl daemon-reload

启动扩展服务

systemctl restart nvidia_gpu_exporter

查看服务状态

systemctl status nvidia_gpu_exporter

如下,该服务占用的端口是 9835

在这里插入图片描述

浏览器访问 http://IP:9835/metrics,可见采集数据,表示服务运行正常

接下来就可以配合 Grafana 创建一些显卡之类的面板(ID:14574 或 ID:25547),或者补充一些显卡之类的告警规则

在这里插入图片描述