应该是6节点网络不通,默认情况下,共享文件系统网络的心跳网络为管理网,需要保证节点间管理网互相通信正常。管理网无法通信时,可以优先检查网卡状态、链路聚合、线路连接情况。
https://zhiliao.h3c.com/Theme/details/232470
应该是节点6系统故障了,这种情况要怎么处理
# CAS:存储池 sys_data 失败,提示 “心跳正在退出或存在于集群之外”
>
> 环境:6 节点 CAS 集群,第 6 节点异常离线;其他节点启动 sys_data 存储池报错。
> 底层文件系统为**OCFS2 共享存储**;节点异常宕机 / 失联,OCFS2 存储心跳锁没有正常释放,磁盘元数据内仍然记录故障节点成员,集群判定存储池还存在该故障节点的心跳会话,拒绝在其他节点挂载存储池。
>
> ⚠️重要前置提醒:**禁止格式化存储卷,存储池内保存虚拟机磁盘数据;所有命令在正常的 CVK 节点 SSH 执行,不要登录故障异常节点操作**。
## 故障根因
节点 6 异常离线,没有正常退出 OCFS2 集群,磁盘上存储池元数据还保留 node06 的成员记录。当其余节点尝试启动 sys_data 存储池,OCFS 检测磁盘集群信息,发现故障节点还标记在集群成员列表,判定 “心跳正在退出或存在集群之外”,阻止存储池启动,防止脑裂双重挂载损坏数据。
## 处理步骤(按顺序执行)
### 步骤 1:确认故障节点状态
1. CVM 平台确认 node06 节点已经失联,无法恢复联机(硬件故障 / 系统卡死)。
2. 确认故障节点已经下电或者网络完全断开,**保证故障节点绝对不会再访问这块共享存储**,避免脑裂双重写盘。
### 步骤 2:正常节点执行命令,强制从存储池中移除故障节点
SSH 登录任意一台正常 CVK 主机执行:
```
# -p存储池名,-n故障节点主机名
cvm storagepool removehost -p sys_data -n node06
```
>
> 这条命令作用:修改共享磁盘上 OCFS2 集群元数据,把故障 node06 从 sys_data 存储池集群成员列表剔除,释放存储心跳锁。
### 步骤 3:在 CVM 界面重新启动存储池
执行完 removehost 后,到 CAS 平台主机存储池页面,重新启动`sys_data`存储池。
- 如果成功启动:检查虚拟机磁盘,业务恢复。
- 如果依旧报同样错误,执行步骤 4。
### 步骤 4:命令行手动扫描存储池,清理本地残留配置
1. 在**所有正常 CVK 节点**执行存储池重新扫描:
```
cvk storagepool rescan
```
2. 如果部分节点本地有残留错误存储池 xml,清理(示例 sys_data)
```
rm -f /etc/libvirt/storage/sys_data.xml
rm -f /etc/libvirt/storage/autostart/sys_data.xml
service libvirtd restart
```
再次界面启动存储池。
### 步骤 5:如果上面操作失败,底层 OCFS 集群信息异常
查看 OCFS 集群配置,检查磁盘上 cluster.conf 信息:
```
ocfs2-tool cluster-config /dev/xxx #存储池对应的磁盘设备
```
- 如果磁盘内部 cluster.conf 仍然残留故障 node06 节点信息,需要使用`ocfs2-tool`清理无效节点;该操作风险较高,建议有条件的情况下联系 H3C 技术支持现场指导,避免元数据损坏。
### 步骤 6:故障节点后续处理
1. 如果后续修复 node06 节点,重装 CVK 系统再重新加入集群;**禁止直接开机,防止旧 OCFS 配置再次干扰共享存储**。
2. 故障节点不要直接开机接入存储网络,必须先重装系统。
## 排查校验点
1. 存储网络(FC/iSCSI)全部正常,各正常节点都可以识别存储卷;
2. 确认故障节点完全隔离,不会访问共享存储,是操作的前提;
3. 查看日志`/var/log/messages`,搜索 o2cb、ocfs2 关键字,确认报错;
4. 6 节点集群 OCFS2,节点异常离线优先用`cvm storagepool removehost`,不要直接操作 ocfs2-tool 工具。
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
应该是节点6系统故障了,这种情况要怎么处理