7503E交换机日志提示板卡在不停的重启,看板卡状态正常,网络通信也正常,这是硬件有故障隐患?未重启,担心会触发故障。日志信息如下:
<H3C-7503E-Core>dis device
Slot No. Brd Type Brd Status Subslot Num Sft Ver Patch Ver
0 LSQ1MPUB Master 0 S7500E-6305P03 None
1 NONE Absent 0 NONE None
2 LSQ1GP24TSC Normal 0 S7500E-6305P03 None
3 LSQ1GP24TSC Normal 0 S7500E-6305P03 None
4 NONE Absent 0 NONE None
<H3C-7503E-Core>dis logb
Logging buffer configuration and contents:enabled
Allowed max buffer size : 1024
Actual buffer size : 512
Channel number : 4 , Channel name : logbuffer
Dropped messages : 0
Overwritten messages : 8153448
Current messages : 512
%Aug 7 07:49:15:335 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=3;
Board is rebooting on Frame 0 Slot 3.
%Aug 7 07:49:15:828 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=2;
Board is rebooting on Frame 0 Slot 2.
%Aug 7 07:50:05:922 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=2;
Board is rebooting on Frame 0 Slot 2.
%Aug 7 07:50:13:16 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=3;
Board is rebooting on Frame 0 Slot 3.
%Aug 7 07:50:37:743 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=2;
Board is rebooting on Frame 0 Slot 2.
%Aug 7 07:50:45:65 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=3;
Board is rebooting on Frame 0 Slot 3.
%Aug 7 07:51:09:658 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=2;
Board is rebooting on Frame 0 Slot 2.
%Aug 7 07:53:11:379 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=3;
Board is rebooting on Frame 0 Slot 3.
%Aug 7 07:53:16:793 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=2;
Board is rebooting on Frame 0 Slot 2.
%Aug 7 07:53:43:187 2026 H3C-7503E-Core DEV/4/BOARD REBOOT:Slot=3;
Board is rebooting on Frame 0 Slot 3.
Slot2、Slot3 两块业务板持续反复上报 BOARD REBOOT(单板软重启),display device 显示状态 Normal、业务不断,说明并非硬件彻底卡死掉板,是业务板频繁软复位,属于明确故障隐患,放任不管后续大概率出现:端口离线、整块板离线、流量断流、极端情况下影响主控。
两块板同时规律重启,优先排查整机环境、背板供电、版本 BUG;其次才是单板自身故障。
一、逐条分析现象特征
两块业务板同步交替重启、不是单块孤立故障
大概率是公共诱因:整机电源、机箱背板、整机温度、系统版本缺陷,而非两块网卡板同时硬件损坏。
重启后状态恢复 Normal、业务正常
属于业务板Watchdog 看门狗触发软重启:业务板 CPU 进程卡死、内存溢出、驱动异常,板卡看门狗检测无喂狗信号,自动复位业务板,不脱离背板、不会直接变成 Absent,所以业务短暂中断后立刻恢复,人感知不到断网,仅日志刷屏。
日志覆盖量极大(Overwritten messages : 8153448)
日志缓存早已溢出反复覆盖,早期原始崩溃原因日志已经丢失,需要开启日志服务器抓取完整崩溃原因。
二、由高到低排查顺序(现场可依次操作)
层级 1:环境与散热(最常见诱因,7503E 高发)
查看整机温度、单板温度
plaintext
display environment
display device temperature slot 2
display device temperature slot 3
业务板芯片温度长期>75℃、瞬时冲到 85℃以上,过热会造成单板进程错乱、看门狗重启;
检查机箱风道:风扇组是否有风扇停转、转速过低、积灰堵塞;7503E 风扇框故障会导致整机局部散热不均,相邻槽位板卡一起过热重启。
机房空调、机柜进风是否正常,槽位 2、3 位置是否被线缆挡住通风口。
层级 2:电源供电 & 背板公共总线故障(两块板同时重启典型原因)
7503E 双电源冗余架构:
plaintext
display power
确认两个电源均为 Present / Normal,不要单电源长期运行;单电源负载过高,背板电压波动,所有业务板供电不稳,出现同步软重启。
现象:电源老化带载能力下降,业务流量高峰期电压小幅抖动,业务板电源芯片检测异常,触发单板复位。
简易验证:维护窗口替换全新电源模块测试,观察日志是否还在刷屏重启。
层级 3:系统版本 BUG(你当前版本 S7500E-6305P03,重点怀疑)
S7500E V5 版本 R6305P03 存在已知缺陷:
特定流量模型(大流量组播、M-LAG、大量 ACL、DHCP Snooping 满表、频繁端口 flap)会造成业务板转发进程死锁,看门狗重启单板,板卡恢复后业务正常,无硬件离线。
解决手段:
升级至该分支稳定终版:S7500E-CMW520-R6305P15,修复业务板 watchdog 误重启 BUG;
升级前务必备份配置、检查 Flash 剩余空间,主控与业务板同步升级。
层级 4:配置过载导致单板资源耗尽
登录查看两块板卡资源占用:
plaintext
display cpu slot 2
display cpu slot 3
display memory slot 2
display memory slot 3
高发触发配置:
Slot2/3 下放了大量 DHCP Snooping、IPSG、DAI 绑定表,表项占满单板内存;
端口下大批量 ACL、QoS 策略、流模板下发过多;
组播复制量大(PIM、组播电视业务),业务板转发进程卡死;
M-LAG、IRF M-LAG 跨板流量过高。
排查:空闲时段关闭 DHCP Snooping / 复杂 ACL 测试,观察板卡是否不再重启。
层级 5:背板故障 / 槽位背板通道损坏
Slot2、3 相邻槽位共享背板通道,背板总线故障会导致两块板卡通信异常、频繁复位。
交叉测试(最精准判定)
维护窗口操作:
将 Slot2 与空闲槽位(Slot4)互换位置;
将 Slot3 挪至其他空闲槽位;
搬迁后,重启故障跟着板卡走 → 单板硬件损坏;
搬迁后,重启故障依旧留在原 Slot2、Slot3 槽位 → 机箱背板该通道故障,机箱报废或禁用该槽位。
层级 6:业务板本身硬件故障(概率偏低,两块同时坏概率很小)
若交叉搬迁槽位后,哪块板搬到哪就重启哪块,说明 LSQ1GP24TSC 单板内部 CPU、内存故障,直接更换备件即可。
三、紧急规避方案(不等升级 / 换硬件,先防业务故障)
开启外部日志服务器(Syslog 服务器),把交换机日志实时发送上去,避免本地 logbuffer 覆盖崩溃根源日志:
plaintext
info-center loghost 192.168.x.x
info-center source DEV channel loghost log level debugging
临时降低单板负载:
关闭无用端口的 DAI、多余 ACL,清理过期 DHCP 绑定表:reset dhcp snooping binding all;
检查风扇,清理灰尘,保证整机温度控制在 65℃以内;
确认双电源同时在线运行,禁止单电源工作。
四、风险预判
当前状态:单板软重启自愈,业务无感知;
恶化趋势:看门狗重启频率越来越高 → 单板彻底离线 → 该槽位所有端口断网;
背板损坏极端场景:多个槽位陆续出现板卡重启,最终整机转发异常。
五、完整排查顺序总结
查风扇、温度 → 2. 检查双电源是否正常冗余 → 3. 抓取远端日志定位崩溃诱因 → 4. 搬迁板卡交叉测试区分「板卡坏 / 背板坏」 → 5. 版本升级修复已知 BUG → 6. 更换故障硬件。
补充排查命令
plaintext
# 查看单板重启历史记录
display device reboot-record slot 2
display device reboot-record slot 3
# 查看风扇状态
display fan
# 查看电源状态
display power
如果执行 display device reboot-record 可以看到每次重启的原因字段(Watchdog Reset / Power Reset / Software Reset),就能精准判定是进程卡死还是供电问题。
Watchdog Reset = 进程卡死(版本 / 配置问题居多)
Power Reset = 电压不稳(电源 / 背板问题)
Software Reset = 人为命令重启,可以排除。
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论