RBM 主备模式下,控制通道(心跳)一断,备机收不到 keepalive,超过失效阈值就会升为 Master → 两台都 Master(脑裂/双主)。这时候如果上下行是靠 VRRP/动态路由选路,就会出现“去程走原主、回程走原备”或“两边都在发 VRRP/路由”,导致 MAC/IP 冲突、路由震荡、来回路径不一致、会话表不同步丢包。
1. 为什么会“双主 + 来回路径不一致”
主备模式正常:只有 Master 转发,VRRP 发通告、OSPF/BGP 发路由,备机静默。
心跳全断:原主认为对端没了,继续当 Master;原备认为对端没了,分裂检测超时后也升 Master。
后果取决于上下行组网:
二层接入(交换机 + VRRP):两台都发 VRRP 通告 → VIP/MAC 冲突,交换机 MAC 表翻转,去程从原主进、回程可能被引到原备 → 非对称路径,状态检测/会话不匹配直接丢包。
三层接入(OSPF/BGP 对接核心):两台都发路由 → 等价路由或路由震荡,回程可能从另一台防火墙回来,而那台没有这条流量的会话表 → 被安全策略/状态检测丢弃。
即使开了 hot-backup enable 会话同步,脑裂期间两台各自建会话、配置也不再同步,回程串到对端还是会出问题。
2. 怎么避免“心跳断 → 双主 → 路径乱”
✅ 必做:防脑裂(让备机在“只是心跳线断了”时不升主)
业务网口连通性检测(peer-ip track / auxiliary remote-ip)
在 RBM 视图配辅助控制通道或对端业务 IP 跟踪:
remote-backup group
auxiliary local interface GigabitEthernet x/x/x
auxiliary remote-ip <对端业务/管理IP>
或老版本:
rbm peer-ip <对端业务IP> track
效果:心跳断了但业务网络还能 ping 通对端 → 备机知道“主机还活着”,维持 Backup,不升主。只有“心跳断 + 业务也断”才切换。
心跳线本身高可用
独立网口 + 独立交换机/直连,不和业务口混用;
有条件做 两条心跳(主控制通道 + 辅助控制通道),控制通道和辅助通道都断才算真故障。
MAD / 分裂检测参数调好
心跳失效阈值别太短(避免抖动误切);
抢占延时 preempt-mode timer delay ≥ 30s,防止链路闪断来回切。
✅ 上下行防“双主发包”的配套手段
VRRP 统一受 RBM 管控(主备模式别手工固定 VRRP 优先级)
RBM 主备会自动把 Master 的 VRRP 置 Active、备机置 Standby;脑裂被上面的 track 防住,就不会出现两台同时发 VRRP。
三层对接用 adjust-cost ospf/bgp enable
主备切换时,备机升主才通告正常 cost;如果真脑裂(业务也断)原主业务口肯定 down,路由自然撤了。正常防脑裂状态下不会两台同时发路由。
真·双主(dual-active)才需要处理的非对称路径
如果你其实是双主模式(不是主备),来回路径不一致要靠:
hot-backup enable + 会话实时同步;
数据通道透传(非对称报文对端透传);
出口 nat preserve-next-hop / ip last-hop hold 让回包原路返回;
但主备模式不要为了“防路径不一致”去开双主宽松模式,安全性会丢。
✅ 切换平滑性
hot-backup enable + session sync 常开,主备切的时候老连接不中断;
心跳口不放业务安全域、不跑 NAT,避免被策略误伤。
3. 你这个场景的标准做法(主备模式)
心跳:两口独立(或 1 主 + 1 辅助业务口 track);
RBM 视图:
remote-backup group
local-ip <心跳本端>
remote-ip <心跳对端>
auxiliary local interface <业务口>
auxiliary remote-ip <对端业务IP>
backup-mode active-standby
hot-backup enable
configuration auto-sync enable
上下行:VRRP 交给 RBM 管,或三层 OSPF + adjust-cost ospf enable;
监测:dis remote-backup-group 看 Control/Aux 通道状态,别只看一条心跳。
只配了一条 HA 线、没配 auxiliary remote-ip / peer-ip track → 线一拔必然双主,这是现场最常见翻车点。
暂无评论
现象:RBM 心跳通道全部中断,原备机收不到 RBM 心跳,分裂计时器超时直接升主,两台防火墙同时为业务主,形成脑裂(双主)。
会话表只在原主设备生成,RBM 通道断开会话同步停止;去程走主墙建立会话,回程报文被二层交给备墙,备墙没有对应会话,ASPF 直接丢弃报文,业务随机断流、时通时断。
关键:RBM 通道断开后,会话同步通道失效,两台设备不再同步会话表,即便业务上下行链路完好,也会出现上述故障。
默认行为:RBM 心跳断开,备机直接升主;必须配置 peer‑ip track 业务连通性检测,做分裂隔离,该机制就是专门解决心跳线断、设备还活着的脑裂场景。
remote-backup group
remote-ip 10.1.1.2 #对端RBM地址
local-ip 10.1.1.1
data-channel interface GigabitEthernet1/0/1
device-role primary
hot-backup enable
#开启分裂隔离,通过业务网检测对端peer‑ip,防止心跳断就无脑升主
peer-ip 10.1.1.2 track
两台防火墙都要配置这条peer‑ip x.x.x.x track。
peer‑ip track分裂隔离;RBM 双主模式没有该命令。remote-backup group
track interface GigabitEthernet1/0/2 #上行业务口
track interface GigabitEthernet1/0/3 #下行业务口
adjust‑cost enable,主备模式备机自动抬高路由开销,正常环境不会产生等价路由,从路由层面规避来回路径不一致风险wwwsg-prox...。remote-backup group
adjust-cost enable
| 场景 | 结果 |
|---|---|
未配置peer‑ip track,RBM 通道全断 | 备机升主,双主;VRRP 冲突 / ECMP 等价路由,来回路径不一致,业务随机丢包 |
配置peer‑ip track,RBM 通道全断,业务网络完好 | 备机不升主,保持 Backup;只有原主处理业务,无双主,业务不受影响 |
| RBM 通道 + 业务网络全部断开(对端整机断电) | peer‑ip 探测失败,备机正常升主接管业务,高可用正常生效 |
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论