单纯管理网中断 → 虚拟机不会触发自动迁移(HA 故障迁移);绝大多数场景虚拟机继续运行,不会自动漂移。
下面区分两套网络、两个关键机制,把原理讲清楚(适配 CAS E08xx/E09xx 版本)
一、先理清 CAS 集群三类网络分工
- 管理网(MGMT)
CVK 主机之间心跳协商、Manager 下发指令、集群元数据交互;
- 存储网
虚拟机磁盘读写、分布式存储数据交互;
- 业务网
虚拟机业务流量。
CAS 集群HA 故障判定,依靠【集群心跳网络】,不是单纯管理网!
二、分两种场景:管理网断了,结果完全不同
场景 1:只有管理网中断,集群心跳网络独立、正常连通(推荐标准组网)
- CVK 之间心跳报文正常收发;
- 集群判定:目标主机只是管理链路不通,主机本身健康、没有宕机;
✅ 不会触发 HA 自动迁移,虚拟机原地持续运行
- 现象:
Manager 平台无法操作这台 CVK、看不到主机状态;虚拟机正常跑;等管理网恢复后页面状态刷新。
场景 2:管理网 和【集群心跳网复用同一套网卡】(很多简易环境的部署方式)
最常见坑:心跳和管理共用 vswitch0 同一网段同一网卡
管理网断 =
主机间心跳同时中断
- 集群内其他 CVK 收不到故障主机心跳;
- 等待集群 HA 心跳超时(默认 120s);
- 集群判定该 CVK 主机失联宕机;
👉 触发 HA 故障迁移,虚拟机在其他正常主机拉起
⚠️致命风险:
故障主机上虚拟机还在本机继续运行(虚拟机没有收到关机信号),
同一台虚拟机同时在两台 CVK 运行 = 双写磁盘,极易造成虚拟机磁盘损坏、文件系统崩溃!
这就是分布式存储 “脑裂风险”。
三、区分【HA 故障迁移】VS【动态资源调度 DRS 热迁移】
-
热迁移(DRS 手动 / 自动负载均衡迁移)
需要 Manager 控制通道、主机之间管理网络互通;
管理网中断后:
无法发起新的热迁移;已经在迁移中的任务大概率中断。
-
HA 故障迁移(主机宕机自动重启虚拟机)
触发条件:集群心跳失联 + 超时判定主机故障;
依赖
心跳链路,不是 Manager 管理链路。
四、关键补充约束(高频误区)
- ❌ CAS 不能依靠业务网、存储网充当集群心跳;心跳网络必须单独配置指定;
- ❌ 只要主机还上电、虚拟机进程还在运行,仅仅管理网断,不属于 “主机故障”;
- ✅ 规避脑裂标准方案:
集群配置双心跳链路(管理网 + 独立心跳网),单条链路断开不会触发 HA 判定;
- 如果分布式存储(CVK 块存储):存储网络必须保证独立,存储网不能跟着一起断。
五、极简故障现象对照表
| 组网情况 | 管理网断开后果 | 是否自动迁移虚拟机 |
|---|
| 管理网与心跳网分离,心跳正常 | 虚拟机持续运行,平台无法管理主机 | ❌ 不会自动迁移 |
| 管理网和心跳网复用,一起断开 | 心跳超时,集群判定主机故障 | ✅ 触发 HA 迁移(存在脑裂风险) |
六、生产环境建议
- 集群部署规范:心跳网络独立规划,不和管理网复用;配置双心跳链路提升可靠性;
- 如果管理网意外中断,不要立刻修复网络:
先确认故障 CVK 主机上虚拟机是否还在运行,避免 HA 迁移完成后,两端同时运行同一虚拟机;
- 可以调低 HA 检测时长,但不建议极端调小,防止网络抖动误触发迁移。
暂无评论