不是直接插上去就完事,新控制器插入后会执行node‑to‑node rescue节点救援,从存活控制器同步系统,不会同步业务数据(业务数据在磁盘柜),业务数据本身在磁盘,不需要重新同步业务卷数据。
⚠️风险:操作不当会导致正常控制器重启、业务中断;建议优先 HPE 原厂工程师操作。
前置条件
确认另外一台控制器完全正常,shownode显示 InCluster,无告警;主机多路径软件正常,IO 全部跑在存活控制器上。
备件控制器FRU/PN 号必须和原控制器完全一致;备件 OS 大版本尽量匹配现有集群版本,否则 rescue 失败。
静电防护;控制器槽位不能空超过 30 分钟,防止过热。
标记所有线缆:前端 HBA 卡 SFP、后端 SAS 线缆、SP 管理口、节点互联线,严格按原位置复原。
分两种场景操作
场景 A:故障控制器已经死机、无法访问(面板蓝灯,已经离线)
直接热拔出故障控制器。
把旧控制器上全部硬件迁移到新控制器(非常关键)
所有内存 DIMM:按原槽位顺序全部迁移,双控缓存必须对称;
前端 PCIe HBA 卡、SFP 光模块;
控制器内部两块系统 SSD(node boot drive),这盘带节点 W19、SN 信息,迁移后 rescue 成功率最高。
将新控制器插入机箱,锁紧扳手,接回全部线缆。
新控制器上电自动启动,执行node‑rescue 节点救援,时间 5‑10 分钟,从存活控制器同步 3PAR OS 系统镜像。
观察指示灯:新控制器绿灯和对端控制器同步闪烁,代表成功加入集群。
场景 B:故障控制器还可以登录、还在集群内(未彻底死掉)
不能直接硬拔!硬拔可能触发对端控制器 panic 重启,业务中断。
CLI 登录存活控制器,执行命令优雅关闭故障节点:
bash
shutdownnode halt <nodeID>
输入 yes 确认,等待节点完全下电,状态灯变为蓝色,再拔硬件。
2. 迁移内存、HBA 卡、SFP、内置系统 SSD 到新备件控制器。
3. 插入新控制器,接回线缆,等待自动 node‑rescue 救援流程。
更换完成后校验命令(必须执行)
bash
shownode # 两个节点状态InCluster,无failed
showversion # 两个节点OS版本完全一致
showpd‑s # 磁盘全部normal,无missing端口
showport‑n # 前端端口online
showtask # 无异常后台任务
checkhealth # 整机健康检查
常见失败场景
rescue 一直不成功:
优先确认节点之间私有互联网线;
确认内存、系统 SSD 是否迁移;
备件 PN 号不对、OS 版本差异过大,需要串口进 Whack > 模式修改节点信息,该操作建议原厂支持做,不建议自行操作。
新控制器 FC WWN 改变:SAN 交换机 zone 需要更新新 WWN,否则主机看不到存储卷。
重要澄清
✅业务数据存放在磁盘柜硬盘,不需要重建卷数据;rescue 只同步控制器操作系统,不是同步业务数据。
❌不能拿裸备件直接插入,不迁移内存、系统 SSD,大概率 rescue 失败,缓存不匹配,写缓存被强制切 write‑through,性能严重下降。
整个更换过程业务不中断,IO 持续由存活控制器接管,但前提是步骤正确。
提示:如果设备还在维保,强烈建议 HPE 工程师上门;非维保自行操作有业务中断风险。
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论