UIS超融合平台不显示存储集群IOPS及存储集群IO吞吐量界面,prometheus-cluster进程每过10秒就重启,1年前也出现过一次,还是原厂上来搞定的的,现在不知道要如何处理了。
[root@cskjcvk-d ~]# supervisorctl status prometheus-cluster
prometheus-cluster RUNNING pid 311096, uptime 0:00:10
[root@cskjcvk-d ~]# supervisorctl status prometheus-cluster
prometheus-cluster STARTING
[root@cskjcvk-d ~]# supervisorctl status prometheus-cluster
prometheus-cluster RUNNING pid 333285, uptime 0:00:02
[root@cskjcvk-d ~]#
prometheus-cluster 进程反复重启,是导致存储集群 IOPS 和吞吐量界面无法显示的根本原因。这通常意味着 Prometheus 监控组件在运行中遇到了无法处理的错误或资源瓶颈。
针对这个问题,你可以尝试从以下几个方向进行排查和恢复:
根据搜索结果,Prometheus 容器因内存超限被强制 kill 是导致频繁重启的常见原因。
操作方法:登录 UIS 管理平台,在 集群 | 工具 | 监控配置 页面中,适当调大 Prometheus 的内存限制。例如,可以将 Prometheus 内存限制 从当前值调整到 8192 MiB 或更高。
注意:调整后观察进程是否恢复稳定。如果问题依旧,再尝试后续步骤。
有时服务进程卡死或状态异常可以通过重启来恢复。
刷新存储监控进程:登录到出现问题的 UIS 物理节点(通过 SSH),执行以下命令来重启存储监控进程,这有助于强制刷新状态:
重启 UIS 核心服务:执行以下命令重启 UIS 的核心服务,这常用于刷新平台的整体状态:
重启前端 Web 服务:如果问题仅出现在界面上,可以尝试重启 Tomcat 服务:
或
在采取更进一步的措施前,务必确认集群底层存储是否健康。
集群节点间时间不同步可能导致服务异常。
检查 NTP 状态:确认所有节点的 NTP 服务是否正常运行,并且时间偏差在允许范围内(通常建议小于 1 秒)。
如果时间偏差过大:需要先修复 NTP 同步问题
可能版本不同,并没有你提到的第一项,V8.0 (E0801P03) ceph -s 显示HEALTH_OK
精简总结
故障因果
prometheus-cluster 每 10 秒循环重启,监控采集中断,UIS 页面无法获取存储 IOPS、吞吐量指标,监控面板空白;常见诱因:时序日志损坏、磁盘占满、内存溢出、双 CVM 争抢文件锁、旧版本内置 Prometheus 存在 BUG。
快速修复步骤
① 查看日志确认崩溃原因,检查系统磁盘是否爆满;
② 停止进程,备份并清空损坏的监控时序目录重建权限,重启进程(绝大多数场景可恢复监控面板);
③ 依旧重启则修改配置,缩短监控数据留存周期、限制内存占用;
④ 双 CVM 集群仅保留主节点运行该进程,避免锁冲突;
⑤ 验证 prometheus 进程稳定运行、采集目标全部正常 UP 即可。
长效规避
监控数据留存由 30 天改为 7 天,保证 CVM 系统盘空闲空间充足;双 CVM 架构备机禁用 prometheus-cluster;最终升级 UIS 至 V7.0.07H03 及以上版本,彻底修复原生 BUG。
兜底方案
清理重置无效时,重装监控组件或升级整套 CVM 补丁。
但是我们版本已经是V8了
你好,我们主备节点都运行这个进程,可以在备节点手动关闭这个进程吗?
但是我们版本已经是V8了
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
可能版本不同,并没有你提到的第一项,V8.0 (E0801P03) ceph -s 显示HEALTH_OK