在CAS平台上看T4的GPU使用率,要分管理界面看虚拟机vGPU利用率和虚拟机内部看物理T4实时利用率两条路径,两者互补。
在CAS管理界面查看虚拟机GPU/vGPU利用率
这是最直接的方式,前提是虚拟机已经分配了vGPU或直通的T4,并且安装了CAStools。
操作路径:
顶部导航栏单击 [资源]
左侧导航栏选择 [虚拟化]
展开虚拟化平台及集群,依次进入集群 → 主机 → 目标虚拟机
选择 "性能监控" 页签
在图表中查看以下GPU相关指标:
GPU/vGPU利用率(横轴时间、纵轴利用率)
GPU/vGPU显存利用率
GPU/vGPU编码率
GPU/vGPU解码率
💡 默认显示最近30分钟的曲线,可以在日期框切换时间范围。
如果是智能资源调度业务下的虚拟机,路径稍有不同:选择顶部"云业务"页签 → 左侧[智能资源调度] → 进入业务的虚拟机信息页面 → 选择"性能监控"页签,同样可以看到上述4个GPU图表。
查看主机上的T4物理设备信息
如果想确认主机上T4显卡的状态(不是实时利用率,而是设备级别信息):
资源 → 虚拟化 → 展开集群 → 单击主机名 → 选择"GPU设备"页签
这里可以看到:
槽位号(Slot Number)
厂商(Manufacturer)
型号(Type)—— 应显示为Tesla T4
ECC状态
该物理GPU虚拟出的vGPU列表(UUID、名称、类型、帧缓冲大小等)
⚠️ 注意:这个页签展示的是设备配置和vGPU分配信息,不是实时利用率曲线。要看T4跑得满不满,还是得走第一条路径或下面的命令行方式。
在虚拟机内部用nvidia-smi查看T4实时使用率
当T4以vGPU或直通方式分配给虚拟机后,在虚拟机操作系统内执行:
nvidia-smi
T4的典型输出示例:
| 0 Tesla T4 On | 00000000:00:1E.0 Off | 0 |
| N/A 45C P0 26W / 70W | 1500MiB / 15109MiB | 0% Default |
关键指标解读:
GPU-Util(上例中的0%):GPU计算核心使用率,0%为空闲,100%为满负荷
Memory-Usage(1500MiB / 15109MiB):显存已用/总量,T4总计约15GB
Temp(45C):温度,正常范围内
Power(26W / 70W):当前功耗/标定TDP
如果需要持续监控:
watch -n 1 nvidia-smi
或以JSON格式输出便于接入监控系统:
nvidia-smi --query-gpu=index,name,temperature.gpu,utilization.gpu,memory.used,memory.total --format=json
📌 使用nvidia-smi的前提是虚拟机内已安装适配的NVIDIA驱动。CAS环境下的虚拟机要选Linux KVM平台的vGPU驱动版本(如440.118.02),且需要连接NVIDIA License Server获取许可。
三条路径的适用场景
查看方式
适用场景
数据粒度
CAS性能监控页
日常巡检、长期趋势
虚拟机vGPU利用率曲线
主机GPU设备页签
确认T4硬件在位、vGPU分配
设备级信息
虚拟机内nvidia-smi
实时排查、性能调优
秒级精确值
如果你是做日常巡检,用第一条路径就够了;如果是排查推理速度慢、显存溢出等问题,直接在虚拟机里跑nvidia-smi最直观。
在CAS平台查看T4 GPU的使用率,主要有两种方式:通过CAS Web管理界面图形化查看,或者登录CVK主机后台使用命令行查看。
这是最直观的方法,适合日常监控。
登录CAS管理平台:通过浏览器访问CVM(Cloud Virtual Machine)节点的Web管理界面。
导航至主机或虚拟机:
查看性能数据:在主机或虚拟机的“性能监控”页面中,可以查看包括CPU、内存、磁盘I/O在内的各项指标。如果GPU监控已启用,这里应该会显示GPU的使用率图表。
请注意:CAS平台对GPU的图形化监控功能,可能需要特定的软件版本才支持。如果Web界面看不到GPU监控数据,可以尝试下面的命令行方式。
这是最直接、兼容性最好的方法,适用于所有安装了NVIDIA驱动的CVK主机。
登录CVK主机:通过SSH等方式,登录到安装了T4 GPU的CVK主机后台。
执行nvidia-smi命令:在命令行中输入以下命令:
这个命令会显示所有NVIDIA GPU的实时状态。
解读输出:在输出结果中,找到你的T4显卡,重点关注以下字段:
GPU-Util:即GPU核心的实时利用率,以百分比表示。
Memory-Usage:显示显存的使用情况,例如 1234MiB / 15109MiB。
动态刷新查看:使用 watch -n 1 nvidia-smi 命令,可以每秒刷新一次GPU状态,实现动态监控。
查看特定GPU:如果服务器有多张T4卡,可以使用 nvidia-smi -i 0 来指定查看索引为0的GPU信息。
驱动安装:确保已在CVK主机上正确安装了NVIDIA GPU驱动,这是nvidia-smi命令能正常执行的前提。
直通与虚拟化:如果GPU是直通(Passthrough)给虚拟机的,那么GPU使用率主要在虚拟机内部查看。如果使用的是vGPU,则可以在CVK主机和虚拟机内部同时查看。
暂无评论
# CAS 平台怎样查看 T4 的 GPU 使用率
>
> 区分两种模式:**GPU 直通**、**vGPU 切分**;CAS 平台 Web 界面能力有限,直通模式和 vGPU 模式查看方式不一样H3C。
## 一、vGPU 模式(MDEV 切分 T4,CAS Web 界面可看)
>
> 虚拟机分配 vGPU 虚拟显卡,新版本 CAS 支持在 CVM 网页查看指标H3C。
1. CVM 网页→【云资源】→找到对应**虚拟机**→【性能监控】页签
2. 图表会展示:**GPU/vGPU 利用率、显存利用率、编解码利用率**
>
> 注意:老版本 CAS(4.0 及更早)没有该图表,只能命令行查看;ARM 主机不显示 GPU 监控图。
## 二、GPU 直通模式(T4 完整直通给一台虚拟机,重点)
>
> **⚠️CAS 的 CVK 宿主机上执行 nvidia‑smi 看不到负载!**
> GPU 直通后,硬件全部透传给虚拟机,驱动运行在虚拟机内部,**CVK 底层无法读取 T4 的算力 / 显存使用率,宿主机执行 nvidia‑smi 会无返回或者报错**NVIDIA。
✅ **必须登录到内部虚拟机操作系统里执行查看**
### Linux 虚拟机
```
#单次查看T4状态,GPU‑Util就是算力使用率
nvidia‑smi
#持续实时刷新(Ctrl+C退出)
watch -n1 nvidia‑smi
```
可以看到:GPU‑Util(算力利用率)、Memory‑Usage 显存占用、温度、功耗、占用 GPU 的进程。
### Windows 虚拟机
1. CMD/PowerShell 执行
```
nvidia‑smi
```
>
> Windows 任务管理器在 T4(TCC 计算模式)下看不到 GPU 算力,只能用`nvidia‑smi`。
## 三、CVK 宿主机能看什么?
CVK 只能识别硬件是否在位:
```
#查看PCI硬件,确认T4卡识别
lspci | grep‑i nvidia
```
直通模式下**CVK 无法读取算力负载指标**,所有利用率统计只能进到虚拟机内部执行`nvidia‑smi`。
## 四、报表导出
1. 如果是 vGPU 模式:CVM【监控告警】‑【虚拟机报表】,可以导出 GPU 历史性能报表。
2. 直通模式:**CAS 平台没有历史报表**,需要在虚拟机内自行写脚本定时采集`nvidia‑smi`输出做历史监控。
## 常见踩坑
1. ❌CVK 上敲`nvidia‑smi`没输出:属于正常现象,直通模式驱动不在宿主机,要进到虚拟机内部执行。
2. ❌CVM 虚拟机性能监控页没有 GPU 图表:版本过低,升级 CAS 到 E0530 及以上版本;直通模式下该图表也不会有数据。
3. 确认虚拟机内部 T4 驱动已经正确安装,未安装驱动时`nvidia‑smi`命令报错。
## 快速排查步骤总结
1. 如果是**vGPU 切分**:优先看 CVM 网页虚拟机性能监控页;
2. 如果是**GPU 完整直通 T4**:登录虚拟机内部执行`nvidia‑smi`;
3. CVK 宿主机只能确认硬件 PCI 识别,**不能看算力、显存使用率**。
暂无评论
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论