平时做技术实践时,很多问题不是概念不会,而是细节没串起来。拿“DeepSeek部署之GPU监控指标接入Prometheus的过程”来说,它看着像小点,放到项目里常会牵出环境、配置、兼容性和维护成本。下面按实际采用顺序,把思路、关键写法和容易踩坑的地方讲清楚,便于大家直接对照操作。
落到代码里,上一篇文章介绍了在GPU主机部署DeepSeek大模型。同时且DeepSeek采用到了GPU资源来进行推理和计算的过程,加速我们模型的回答速度。
从实现思路看,由此,我们必须要关注主机GPU的监控指标情况,比如总的显卡显存大小、占用的显存大小、显卡的版本信息、驱动信息等等,才能对CPU运行情况、借助率等做到心中有数,便于后期的运维、高可用性等。
地址: GitHub - utkuozdemir/nvidia_gpu_exporter: Nvidia GPU exporter for prometheus using nvidia-smi binary
落到代码里,能够采用nvidia_gpu_exporter本质原理是用过nvidia-smi指令采集GPU的信息,随后转换为prometheus metric。
从实现思路看,所以部署nvidia_gpu_exporter之前,需正常安装号nvidia-smi,同时且安装好了nvidia驱动、CUDA驱动等。
正常执行nvidia-smi如下所示:
nvidia-smi

执行docker命令:
docker run -d --gpus=all -p 32768:9835 utkuozdemir/nvidia_gpu_exporter:1.3.0-amd64

在这个场景下,借助curl访问主机的32768(端口能够自己做映射), 访问/metrics接口看是否能够正常拿到指标数据:
curl -s localhost:32768/metrics | grep 'nvidia'

设置promethues.yml文件:

查看promethues的target是否正常能采集到数据:

搜索指标是否已经入库:

搜索gpu关键词,查询到面板ID:

实际处理时,面板能够看到GPU的型号是RTX 4090、显存的采用情况等指标, 此时我正在服务器运行deepseek-r1:1.5b的模型,所以看到GPU的相关采用。如果将模型停止运行,则GPU基本上无占用

在这个场景下,AI人工智能、大模型等理论知识我们都能多少了解点,但是今天看了一些大佬的教程,稍微深入了一下采用PyTorch进行了一些基础、轻松模型的训练以及部署运行, 发现从零开始去尝试做机器学习的相关开发工作简直是天方夜谈,涉及到的就是各种概率学、统计学、线性代数、算法等等,门槛是相当高。
落到代码里,既然无法做开发,那么从运维工程师的角度出发,了解PyTorch、tensorflow等深度学习框架的部署、模型的运行等等,继续在运维路上前进,扬长避短,才能发挥自我优势!
到此这篇关于DeepSeek部署之GPU监控指标接入Prometheus的文章就介绍到这了,更多相关DeepSeek GPU接入Prometheus内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多兼容脚本之家!