添加的共享存储收通过fc添加的,因该排查什么协议
现象总结
集群共 13 台 CVK;由非欧拉版本升级至 CAS 欧拉 R0785P03;12 台节点添加共享存储正常,仅 1 台节点报错【该存储无法访问】。
关键背景:升级操作系统后出现单点异常,其余节点正常 → 问题锁定在故障节点本地系统、服务、配置、内核模块、防火墙、残留旧版本缓存,排除存储侧全局权限问题。
根因优先级排序(由高到低)
1、升级后节点本地服务异常(最高概率)
CAS 依赖cvk-agent、fsmd存储管理服务,跨系统版本升级(非欧拉→欧拉)极易出现服务文件残缺、自启异常。
正常节点升级包完整,故障节点升级过程存在中断 / 文件缺失。
2、欧拉系统防火墙 / SELinux 策略差异
旧版非欧拉系统防火墙规则宽松;升级欧拉后 firewalld 默认策略收紧,故障节点防火墙拦截存储协议报文(iSCSI/NFS/CIFS)。其他节点升级后自动生成放行规则,此节点规则未同步。
3、OCFS2/O2CB 集群残留信息(共享文件系统场景)
升级前节点非正常卸载共享存储,本地遗留集群心跳信息;新系统 OCFS2 进程判定节点锁冲突,拒绝挂载共享文件系统。
4、多路径 / 存储内核模块加载异常(SAN/iSCSI 存储)
multipathd、open-iscsi服务启动失败;multipath.conf配置与正常节点不一致,WWID 黑名单异常,无法识别存储 LUN。
5、主机标识、集群缓存不一致
升级后 CVM 集群数据库内主机信息与故障节点本地标识不匹配,存储托管校验失败。
6、底层网络驱动 / 网卡参数异常
升级欧拉内核后网卡驱动变更,存储网存在丢包、MTU 不匹配,仅单节点链路异常。
标准化分层排查步骤(现场直接执行)
操作前提:确认存储类型(NFS /iSCSI/ FC SAN),先收集报错界面完整截图。
第一层:基础连通性测试(故障节点 SSH 执行)
bash
#1. 连通性
ping 存储IP
#iSCSI测试端口3260;NFS测试2049、111
telnet 存储IP 3260
#2. 临时关闭防火墙验证(测试用!业务低峰执行)
systemctl stop firewalld
setenforce 0
✅关闭防火墙后可以添加存储 → 永久方案:配置 firewalld 放行存储协议端口。
第二层:CAS 存储相关服务校验
bash
#查看核心服务状态
systemctl status cvk-agent
systemctl status fsmd
systemctl status open-iscsid
systemctl status multipathd
#异常则重启
systemctl restart cvk-agent
systemctl restart fsmd
查看日志定位报错:
bash
journalctl -u cvk-agent -n 100
journalctl -u fsmd -n 100
第三层:SAN/iSCSI 存储额外检查
bash
#发现存储目标
iscsiadm -m discovery -t st -p 存储IP
#多路径查看设备
multipath -ll
对比正常节点输出,若无法发现 target:iscsi 服务异常 / 网络拦截。
第四层:NFS 共享存储额外检查
bash
showmount -e 存储IP
#无法获取导出列表:客户端组件缺失/防火墙拦截
第五层:集群残留 OCFS2 清理(共享文件系统场景)
⚠️风险操作!确认该节点无虚拟机使用此共享存储
bash
#停止ocfs2集群服务
systemctl stop o2cb
systemctl stop ocfs2
#清理本地挂载残留
umount /vms/对应存储目录
第六层:CAS 平台层面修复方案
方案 A:主机【重新托管】(优先尝试,界面操作)
CAS 平台 → 主机管理 → 选中故障 CVK 主机 → 更多操作 → 重新托管
作用:清空节点集群缓存、重新注册 CVM、同步存储配置。
方案 B:清理主机与存储池关联(命令行,CVM 主控执行)
bash
#删除主机在存储池内旧关联信息
cvm storagepool removehost -p 存储池名称 -n 故障主机名
执行完成后,在故障节点重新添加共享存储。
第七层:终极验证手段
将故障节点重启(升级操作系统后部分内核模块必须重启才能正常加载)
重启无效:对比正常节点 /etc/multipath.conf、/etc/ocfs2/cluster.conf配置差异
平台升级后单个节点无法添加共享存储,而其他节点正常,这通常是该节点升级过程中残留了旧配置、状态不一致,或新系统环境下缺少依赖组件导致的。
你可以按照从易到难的顺序,依次排查以下几个方向:
这是最常见的原因,故障节点可能因配置问题无法访问存储网络。
检查端口连通性:确认存储协议端口是否开放。例如,NFS使用2049端口,CIFS使用445端口:
检查存储访问权限:
检查多路径状态:如果是SAN存储,需检查多路径服务是否正常。
如果连通性没问题,问题很可能出在故障节点上残留了升级前的存储配置信息。
现象:节点异常退出时未正常卸载(umount)共享存储,导致集群仍认为它在占用资源。
解决方法:
登录正常CVM节点,执行命令强制解除故障主机与存储池的关联:
登录故障节点,清理本地残留的存储池配置文件并重新扫描:
现象:报错信息中包含“集群配置文件不一致”或“cluster.conf”字样。
解决方法:
检查并统一所有节点的 /etc/default/o2cb 文件中的 O2CB_FENCE_METHOD 参数,确保一致。
在所有节点上重启OCFS2服务:
新系统可能缺少必要的存储客户端软件。
如果以上步骤无效,可以尝试在管理平台进行操作。
如果问题依旧,需要查看系统日志来定位具体错误。
FSM日志:/var/log/fsm/fsm_core.log 和 /var/log/fsm/fsm_event.log
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
添加的共享存储收通过fc添加的,因该排查什么协议