• 全部
  • 经验案例
  • 典型配置
  • 技术公告
  • FAQ
  • 漏洞说明
  • 全部
  • 全部
  • 大数据引擎
  • 知了引擎
产品线
搜索
取消
案例类型
发布者
是否解决
是否官方
时间
搜索引擎
匹配模式
高级搜索

7.0超融合数据硬盘2块故障

1天前提问
  • 0关注
  • 0收藏,79浏览
QMXX 零段
粉丝:0人 关注:2人

问题描述:

7.0 版本 一节点 一次性坏掉2块数据盘,目前故障节点 磁盘使用率太高  没办法删掉故障磁盘,有没好的方案进行故障盘更换工作。

3 个回答
粉丝:1人 关注:3人

最稳妥的方案是优先检查并利用集群内的热备盘机制进行自动重建。如果热备盘不足或重建受阻,则需通过在线扩容集群存储资源来降低使用率,解除系统限制,随后再按标准流程进行物理换盘。切勿在数据未完全重建前强制移除磁盘,以免导致数据丢失。

暂无评论

粉丝:26人 关注:1人

一块节点同时坏两块数据盘,确实是个比较棘手的情况。磁盘使用率高导致无法直接删除故障盘,是这个问题的核心难点

最稳妥的思路是优先考虑数据重建,而不是强行删除磁盘,以确保数据安全

📊 第一步:立即评估集群状态

在动手前,请务必先确认以下信息:

  • 检查集群健康度:登录UIS管理平台,查看存储集群的健康状态是否为 health_ok

  • 确认故障盘类型:明确坏掉的是数据盘还是缓存盘。如果是缓存盘故障,处理方式会复杂得多。

  • 检查硬件状态:通过服务器的HDM或BMC界面,确认物理硬盘的实际状态(如failedoffline)。

  • 确认版本与功能:查看你的UIS具体版本号,确认是否支持“一键换盘”功能。一般来说,较新的版本(如E0730及以后)可能支持,而R4900 G3及以前的老机型可能不支持。

🛠️ 第二步:按优先级尝试解决方案

根据你的情况,可以按以下顺序尝试:

方案一:利用热备盘自动重建(最理想)

检查集群中是否有热备盘(Hot Spare)。如果有,系统理论上会自动使用热备盘进行数据重建

  • 操作:在管理平台监控数据重建进度即可,期间不要进行其他操作。

  • 后续:重建完成后,新盘会自动顶替故障盘的角色。之后,你可以按照标准流程物理更换故障盘

方案二:扩容集群以降低磁盘使用率(推荐)

如果热备盘不足或重建未自动触发,问题就在于磁盘使用率太高,阻止了系统移除故障盘。你需要先“腾出空间”。

  • 操作:向集群中在线添加新的、健康的存储节点或磁盘,进行在线扩容

  • 目的:扩容后,集群的整体存储压力会下降,磁盘使用率随之降低。当使用率降到阈值以下后,系统通常就能允许你执行移除故障盘的操作了

  • 后续:成功移除故障盘后,再按照标准流程进行物理更换。

方案三:手动换盘(需谨慎操作)

如果以上方案都行不通,或者你的环境不支持,则需手动操作。

  1. 确认换盘方式

    • 如果支持“一键换盘”:这是最简单安全的方式。在管理平台找到故障盘,点击“更换磁盘”按钮,按界面提示操作即可。新盘插入后,系统通常会自动识别并开始数据重建

    • 如果不支持“一键换盘”:风险较高,建议联系H3C技术支持(400热线)协助。若必须自行操作,核心原则是先在管理界面或后台将故障磁盘“移除”(Remove),等系统完成数据迁移后,再进行物理更换。

  2. 物理更换硬盘

    • 准备一块型号、容量、固件版本都完全相同或官方兼容的新硬盘

    • 在确认系统已完成移除操作后,小心地拔出故障盘,插入新硬盘

  3. 后续处理

    • 登录管理界面,手动同步磁盘扫描新硬件,让系统识别新盘。

    • 如果系统未自动添加,需手动将新盘添加到存储池

    • 监控数据重建数据均衡的进度,直到完成。

    • 对于某些RAID卡(如MR9361-8i),在换盘后可能需要在RAID卡命令行中清除残留的缓存delete preservedCache)。

⚠️ 重要注意事项

  • 数据备份:任何操作前,请务必备份重要数据

  • 切勿强制操作绝对不要在数据未完成重建前,强制移除或拔掉硬盘

  • 寻求官方支持:如果对任何步骤没有把握,最安全的方式是立即联系H3C官方技术支持(400热线)

暂无评论

粉丝:23人 关注:2人

当前集群为三副本机制,同一节点同时两块数据盘离线,存在副本缺失风险;节点容量占用逼近 97% 红线,存储写入阈值临近,随时可能触发存储只读保护,优先禁止创建虚拟机、快照、磁盘扩容等写入操作。
Web 页面直接删除故障磁盘失败根因:分布式存储剩余空间不足,系统无法将故障盘上数据重构迁移至其他磁盘,拦截删除操作。
两套落地处置方案(优先方案 1,无业务迁移)
方案 1:临时扩容承载重构数据(推荐,原地修复)
前提:该服务器存在空闲未使用硬盘(截图可见sdg、sdh两块 HDD 状态【未使用】)
先将空闲磁盘加入硬盘池 diskpool_hdd
CVM 页面选中 sdg/sdh,添加进数据硬盘池;新增磁盘扩充集群可用容量。
新增磁盘后集群空闲空间上涨,满足数据重构最低容量条件。
等待集群自动数据重构(观察存储平衡进度)
重构完成后,故障磁盘内数据迁移完毕;
正常在页面执行移除故障磁盘,之后下电服务器更换物理硬盘;
新硬盘上架后添加进硬盘池,再次等待集群均衡完成。
⚠️关键点:不要一次性同时加入两块空闲盘,建议先加一块,观察空间与重构负载。
方案 2:虚拟机迁移 + 清空节点(无空闲硬盘备选方案)
如果没有闲置磁盘可用,只能降低本节点数据总量:
将故障节点上全部运行虚拟机迁移至另外两台健康 cvk 节点;
虚拟机迁移完成、确认业务正常;
等待集群副本重构完成,释放故障节点磁盘数据占用;
再执行故障磁盘移除,服务器停机更换硬盘。
弊端:产生大量跨节点数据迁移,业务窗口要求大。
重要操作红线(严禁操作)
禁止强制后台命令强行删除故障磁盘
UIS7.0 底层 ceph 环境,空间不足强制删盘,极易直接造成数据副本永久性丢失。
不要关闭【数据平衡】
页面存在关闭数据平衡按钮,平衡暂停会阻碍副本重构,加剧风险。
重构期间不要再新增业务、创建快照、克隆虚拟机,减少存储 IO 压力。
配套应急操作
临时关闭所有虚拟机自动快照策略,避免持续占用存储空间;
清理无用快照、废弃虚拟机磁盘,尽可能挤出少量空闲空间辅助重构;
全程监控存储使用率,不要让利用率持续上涨冲破 97% 只读阈值。
故障盘更换完整最简流程(匹配你现场截图)
把节点内未使用的 sdh/sdg 加入 diskpool_hdd 数据池;
持续观察存储平衡、副本重构进度,保证集群三副本完整;
重构结束,页面正常移除两块异常故障磁盘;
服务器停机,更换新物理硬盘;
开机识别硬盘,添加进硬盘池,等待集群再次均衡。

暂无评论

编辑答案

你正在编辑答案

如果你要对问题或其他回答进行点评或询问,请使用评论功能。

分享扩散:

提出建议

    +

亲~登录后才可以操作哦!

确定

亲~检测到您登陆的账号未在http://hclhub.h3c.com进行注册

注册后可访问此模块

跳转hclhub

你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作

举报

×

侵犯我的权益 >
对根叔社区有害的内容 >
辱骂、歧视、挑衅等(不友善)

侵犯我的权益

×

泄露了我的隐私 >
侵犯了我企业的权益 >
抄袭了我的内容 >
诽谤我 >
辱骂、歧视、挑衅等(不友善)
骚扰我

泄露了我的隐私

×

您好,当您发现根叔知了上有泄漏您隐私的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您认为哪些内容泄露了您的隐私?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)

侵犯了我企业的权益

×

您好,当您发现根叔知了上有关于您企业的造谣与诽谤、商业侵权等内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到 pub.zhiliao@h3c.com 邮箱,我们会在审核后尽快给您答复。
  • 1. 您举报的内容是什么?(请在邮件中列出您举报的内容和链接地址)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
  • 3. 是哪家企业?(营业执照,单位登记证明等证件)
  • 4. 您与该企业的关系是?(您是企业法人或被授权人,需提供企业委托授权书)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

抄袭了我的内容

×

原文链接或出处

诽谤我

×

您好,当您发现根叔知了上有诽谤您的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您举报的内容以及侵犯了您什么权益?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

对根叔社区有害的内容

×

垃圾广告信息
色情、暴力、血腥等违反法律法规的内容
政治敏感
不规范转载 >
辱骂、歧视、挑衅等(不友善)
骚扰我
诱导投票

不规范转载

×

举报说明