• 全部
  • 经验案例
  • 典型配置
  • 技术公告
  • FAQ
  • 漏洞说明
  • 全部
  • 全部
  • 大数据引擎
  • 知了引擎
产品线
搜索
取消
案例类型
发布者
是否解决
是否官方
时间
搜索引擎
匹配模式
高级搜索

UIS超融合平台不显示存储集群IOPS及存储集群IO吞吐量界面

1天前提问
  • 0关注
  • 0收藏,51浏览
粉丝:0人 关注:0人

问题描述:

 

UIS超融合平台不显示存储集群IOPS及存储集群IO吞吐量界面,prometheus-cluster进程每过10秒就重启,1年前也出现过一次,还是原厂上来搞定的的,现在不知道要如何处理了。

 

[root@cskjcvk-d ~]# supervisorctl status prometheus-cluster

prometheus-cluster               RUNNING   pid 311096, uptime 0:00:10

[root@cskjcvk-d ~]# supervisorctl status prometheus-cluster

prometheus-cluster               STARTING

[root@cskjcvk-d ~]# supervisorctl status prometheus-cluster

prometheus-cluster               RUNNING   pid 333285, uptime 0:00:02

[root@cskjcvk-d ~]#

 

 

3 个回答
粉丝:27人 关注:1人

prometheus-cluster 进程反复重启,是导致存储集群 IOPS 和吞吐量界面无法显示的根本原因。这通常意味着 Prometheus 监控组件在运行中遇到了无法处理的错误或资源瓶颈。

针对这个问题,你可以尝试从以下几个方向进行排查和恢复:

🔍 排查与解决步骤

1. 优先排查:监控组件内存溢出 (最常见原因)

根据搜索结果,Prometheus 容器因内存超限被强制 kill 是导致频繁重启的常见原因

  • 操作方法:登录 UIS 管理平台,在 集群 | 工具 | 监控配置 页面中,适当调大 Prometheus 的内存限制。例如,可以将 Prometheus 内存限制 从当前值调整到 8192 MiB 或更高

  • 注意:调整后观察进程是否恢复稳定。如果问题依旧,再尝试后续步骤。

2. 尝试刷新或重启相关服务 (风险较低)

有时服务进程卡死或状态异常可以通过重启来恢复。

  • 刷新存储监控进程:登录到出现问题的 UIS 物理节点(通过 SSH),执行以下命令来重启存储监控进程,这有助于强制刷新状态

    bash
    supervisorctl restart onestor-peon
  • 重启 UIS 核心服务:执行以下命令重启 UIS 的核心服务,这常用于刷新平台的整体状态

    bash
    systemctl restart uis-core.service
  • 重启前端 Web 服务:如果问题仅出现在界面上,可以尝试重启 Tomcat 服务

    bash
    systemctl restart tomcat8.service

    bash
    service tomcat8 restart

  • 观察效果:执行命令后,回到 UIS 前台界面,等待几分钟后刷新页面,查看 IOPS 和吞吐量界面是否恢复

3. 检查集群底层健康状态

在采取更进一步的措施前,务必确认集群底层存储是否健康。

  • 检查存储集群状态:在后台执行 ceph -s 命令,查看集群的 health 状态是否为 HEALTH_OK

  • 如果状态异常:不建议进行任何重启操作,应先定位并解决存储集群的故障,否则可能加剧数据风险

4. 检查集群时间同步 (NTP)

集群节点间时间不同步可能导致服务异常。

  • 检查 NTP 状态:确认所有节点的 NTP 服务是否正常运行,并且时间偏差在允许范围内(通常建议小于 1 秒)。

  • 如果时间偏差过大:需要先修复 NTP 同步问题

可能版本不同,并没有你提到的第一项,V8.0 (E0801P03) ceph -s 显示HEALTH_OK

zhiliao_9iri8d 发表时间:1天前 更多>>

可能版本不同,并没有你提到的第一项,V8.0 (E0801P03) ceph -s 显示HEALTH_OK

zhiliao_9iri8d 发表时间:1天前
粉丝:25人 关注:2人

精简总结
故障因果
prometheus-cluster 每 10 秒循环重启,监控采集中断,UIS 页面无法获取存储 IOPS、吞吐量指标,监控面板空白;常见诱因:时序日志损坏、磁盘占满、内存溢出、双 CVM 争抢文件锁、旧版本内置 Prometheus 存在 BUG。
快速修复步骤
① 查看日志确认崩溃原因,检查系统磁盘是否爆满;
② 停止进程,备份并清空损坏的监控时序目录重建权限,重启进程(绝大多数场景可恢复监控面板);
③ 依旧重启则修改配置,缩短监控数据留存周期、限制内存占用;
④ 双 CVM 集群仅保留主节点运行该进程,避免锁冲突;
⑤ 验证 prometheus 进程稳定运行、采集目标全部正常 UP 即可。
长效规避
监控数据留存由 30 天改为 7 天,保证 CVM 系统盘空闲空间充足;双 CVM 架构备机禁用 prometheus-cluster;最终升级 UIS 至 V7.0.07H03 及以上版本,彻底修复原生 BUG。
兜底方案
清理重置无效时,重装监控组件或升级整套 CVM 补丁。

但是我们版本已经是V8了

zhiliao_9iri8d 发表时间:1天前 更多>>

你好,我们主备节点都运行这个进程,可以在备节点手动关闭这个进程吗?

zhiliao_9iri8d 发表时间:1天前

但是我们版本已经是V8了

zhiliao_9iri8d 发表时间:1天前
zhiliao_9iri8d 知了小白
粉丝:0人 关注:0人

谢谢各位大佬,问题已经解决,方法是借鉴了https://zhiliao.h3c.com/Theme/details/232051这个帖子里的思路,删除主备节点的文件,必须同时删除,否则它们会互相备份的

编辑答案

你正在编辑答案

如果你要对问题或其他回答进行点评或询问,请使用评论功能。

分享扩散:

提出建议

    +

亲~登录后才可以操作哦!

确定

亲~检测到您登陆的账号未在http://hclhub.h3c.com进行注册

注册后可访问此模块

跳转hclhub

你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作

举报

×

侵犯我的权益 >
对根叔社区有害的内容 >
辱骂、歧视、挑衅等(不友善)

侵犯我的权益

×

泄露了我的隐私 >
侵犯了我企业的权益 >
抄袭了我的内容 >
诽谤我 >
辱骂、歧视、挑衅等(不友善)
骚扰我

泄露了我的隐私

×

您好,当您发现根叔知了上有泄漏您隐私的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您认为哪些内容泄露了您的隐私?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)

侵犯了我企业的权益

×

您好,当您发现根叔知了上有关于您企业的造谣与诽谤、商业侵权等内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到 pub.zhiliao@h3c.com 邮箱,我们会在审核后尽快给您答复。
  • 1. 您举报的内容是什么?(请在邮件中列出您举报的内容和链接地址)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
  • 3. 是哪家企业?(营业执照,单位登记证明等证件)
  • 4. 您与该企业的关系是?(您是企业法人或被授权人,需提供企业委托授权书)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

抄袭了我的内容

×

原文链接或出处

诽谤我

×

您好,当您发现根叔知了上有诽谤您的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您举报的内容以及侵犯了您什么权益?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

对根叔社区有害的内容

×

垃圾广告信息
色情、暴力、血腥等违反法律法规的内容
政治敏感
不规范转载 >
辱骂、歧视、挑衅等(不友善)
骚扰我
诱导投票

不规范转载

×

举报说明