UIS 超融合首页【存储集群 IOPS、存储集群 IO 吞吐量】无曲线图
现象:虚拟机、主机性能监控有数据,唯独首页存储集群 IOPS / 吞吐量为空曲线;虚拟机读写业务正常,存储业务不受影响,仅监控采集异常。
原理:首页存储 IO 指标,由 ONEStor 存储的onestor‑peon采集进程采集底层存储性能指标,上报给 UIS‑Core,前端页面渲染图表;该进程异常就会出现业务正常,监控图表空白。
分层排查顺序(从简单到复杂)
第一步:确认底层存储集群本身健康
登录任意一个存储节点 SSH:
bash
# UIS自研ONEStor存储
storagectl cluster status
# 如果是Ceph底层
ceph -s
必须为健康状态HEALTH_OK,如果集群告警、OSD down、正在数据重平衡,部分版本会停止输出性能统计指标,图表无数据。
业务正常不代表集群是 OK,轻微告警会影响监控指标输出。
第二步:检查时间同步(高频踩坑)
所有超融合节点时间必须严格同步(NTP)。节点之间时差过大,时序数据库直接丢弃性能指标,页面曲线空白。
bash
date
chronyc sources
所有节点时间偏差建议小于 30s。
第三步:检查存储采集进程 onestor‑peon(最常见根因)
onestor‑peon负责读取存储集群 IOPS、吞吐量统计,进程卡死、异常退出,首页存储监控直接空白,但是业务完全不受影响。
bash
#查看进程状态
supervisorctl status onestor‑peon
#如果stop/fatal,重启采集进程
supervisorctl restart onestor‑peon
重启完成后,等待5‑10 分钟,再刷新首页页面,等待采集一轮周期。
日志路径:/var/log/onestor/peon.log,可以查看采集报错。
第四步:UIS‑Core 核心平台服务异常
onestor‑peon 采集到数据,但无法提交给平台核心服务。
bash
systemctl status uis‑core.service
systemctl restart uis‑core.service
注意:重启 uis‑core 只影响 Web 管理平台,不会中断虚拟机和存储业务,管理页面短暂断开 1‑2 分钟。
第五步:区分现象定位问题边界
首页存储 IOPS 无数据;【监控‑性能】里面单台主机、单台虚拟机 IOPS 有数据
→ 100% 问题在存储侧采集进程 onestor‑peon,和计算节点监控无关,优先处理 peon 进程。
全部性能图表都为空(主机、虚拟机、存储全部无数据)
→ 问题在 Prometheus 时序数据库、uis‑core、NTP 时间不同步。
第六步:底层验证存储是否可以输出性能统计
后台直接手动查看集群真实 IO,确认存储本身可以输出统计,排除存储层不输出指标:
bash
#查看集群实时IO统计
storagectl cluster stats
✅如果命令能输出读写 IOPS、吞吐数值:存储底层正常,问题就是采集上报链路(peon/uis‑core)。
❌如果这条命令本身返回空 / 报错:存储集群元数据异常,优先处理存储集群健康。
第七步:版本已知缺陷
部分早期 UIS 版本存在 bug:集群发生过节点上下线、OSD 重启后,onestor‑peon卡死,不再采集存储性能,需要重启 peon 进程恢复,长期根治建议升级目标版本。
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论