一块节点同时坏两块数据盘,确实是个比较棘手的情况。磁盘使用率高导致无法直接删除故障盘,是这个问题的核心难点。
最稳妥的思路是优先考虑数据重建,而不是强行删除磁盘,以确保数据安全。
在动手前,请务必先确认以下信息:
检查集群健康度:登录UIS管理平台,查看存储集群的健康状态是否为 health_ok。
确认故障盘类型:明确坏掉的是数据盘还是缓存盘。如果是缓存盘故障,处理方式会复杂得多。
检查硬件状态:通过服务器的HDM或BMC界面,确认物理硬盘的实际状态(如failed、offline)。
确认版本与功能:查看你的UIS具体版本号,确认是否支持“一键换盘”功能。一般来说,较新的版本(如E0730及以后)可能支持,而R4900 G3及以前的老机型可能不支持。
根据你的情况,可以按以下顺序尝试:
检查集群中是否有热备盘(Hot Spare)。如果有,系统理论上会自动使用热备盘进行数据重建。
如果热备盘不足或重建未自动触发,问题就在于磁盘使用率太高,阻止了系统移除故障盘。你需要先“腾出空间”。
如果以上方案都行不通,或者你的环境不支持,则需手动操作。
确认换盘方式:
物理更换硬盘:
后续处理:
暂无评论
当前集群为三副本机制,同一节点同时两块数据盘离线,存在副本缺失风险;节点容量占用逼近 97% 红线,存储写入阈值临近,随时可能触发存储只读保护,优先禁止创建虚拟机、快照、磁盘扩容等写入操作。
Web 页面直接删除故障磁盘失败根因:分布式存储剩余空间不足,系统无法将故障盘上数据重构迁移至其他磁盘,拦截删除操作。
两套落地处置方案(优先方案 1,无业务迁移)
方案 1:临时扩容承载重构数据(推荐,原地修复)
前提:该服务器存在空闲未使用硬盘(截图可见sdg、sdh两块 HDD 状态【未使用】)
先将空闲磁盘加入硬盘池 diskpool_hdd
CVM 页面选中 sdg/sdh,添加进数据硬盘池;新增磁盘扩充集群可用容量。
新增磁盘后集群空闲空间上涨,满足数据重构最低容量条件。
等待集群自动数据重构(观察存储平衡进度)
重构完成后,故障磁盘内数据迁移完毕;
正常在页面执行移除故障磁盘,之后下电服务器更换物理硬盘;
新硬盘上架后添加进硬盘池,再次等待集群均衡完成。
⚠️关键点:不要一次性同时加入两块空闲盘,建议先加一块,观察空间与重构负载。
方案 2:虚拟机迁移 + 清空节点(无空闲硬盘备选方案)
如果没有闲置磁盘可用,只能降低本节点数据总量:
将故障节点上全部运行虚拟机迁移至另外两台健康 cvk 节点;
虚拟机迁移完成、确认业务正常;
等待集群副本重构完成,释放故障节点磁盘数据占用;
再执行故障磁盘移除,服务器停机更换硬盘。
弊端:产生大量跨节点数据迁移,业务窗口要求大。
重要操作红线(严禁操作)
禁止强制后台命令强行删除故障磁盘
UIS7.0 底层 ceph 环境,空间不足强制删盘,极易直接造成数据副本永久性丢失。
不要关闭【数据平衡】
页面存在关闭数据平衡按钮,平衡暂停会阻碍副本重构,加剧风险。
重构期间不要再新增业务、创建快照、克隆虚拟机,减少存储 IO 压力。
配套应急操作
临时关闭所有虚拟机自动快照策略,避免持续占用存储空间;
清理无用快照、废弃虚拟机磁盘,尽可能挤出少量空闲空间辅助重构;
全程监控存储使用率,不要让利用率持续上涨冲破 97% 只读阈值。
故障盘更换完整最简流程(匹配你现场截图)
把节点内未使用的 sdh/sdg 加入 diskpool_hdd 数据池;
持续观察存储平衡、副本重构进度,保证集群三副本完整;
重构结束,页面正常移除两块异常故障磁盘;
服务器停机,更换新物理硬盘;
开机识别硬盘,添加进硬盘池,等待集群再次均衡。
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论