一、这句话本质含义
割正式更换核心交换机之前,连续完整 24 小时不间断监控整张网络,达成两个目的:
摸清当前网络基线:正常时段、业务高峰时段的带宽、组播、风暴、设备负载;
验证现有环网 / 冗余架构健康:链路故障、断一根链路时,业务能否正常倒换、无大面积掉线,确认原有冗余架构没有隐性故障,避免割接当天旧网本身就带病运行,叠加割接操作直接崩盘。
监测维度分为三块:链路状态、流量基线、业务在线状态、冗余倒换可靠性。
二、整套落地实现方法(适配你现有 H3C S5500V2、核心环网架构)
方式 1:依托现有网管平台(iMC/Ucenter,推荐,自动化 24 小时记录)
开启设备 SNMP(v2c/v3),所有接入、汇聚、核心交换机添加进 iMC
在 iMC 性能监控模块添加监控指标,采集周期 1~5 分钟,持续采集 24h:
表格
监控对象 采集指标 观测目的
核心环网互联链路、上下行 Trunk 链路 出入带宽利用率、错误包、CRC、丢包、瞬时广播风暴 早晚高峰是否拥塞、有无隐性故障链路
两台旧核心交换机 CPU、内存、端口错包、IRF 堆叠状态 CPU 峰值、内存占用、堆叠是否频繁分裂 核心本身是否不稳定
全网接入交换机 在线终端数量、iNode 在线用户数(EIA 组件) 业务在线率:早晚上下班高峰期在线人数是否平稳,无莫名批量掉线
环网冗余链路 链路 STP 状态、阻塞端口位置变化记录 确认环网始终只有一条链路被 STP 阻塞,不会乱飘、频繁震荡
开启 iMC 告警:链路 down、CPU>80%、端口错包突增、终端批量下线全部触发邮件 / 钉钉告警。
连续跑满 24 小时,导出性能报表,作为割接基线资料。
方式 2:无网管平台,纯交换机命令 + 服务器日志采集(纯手工低成本方案)
1)定时采集链路与设备状态(写 Linux 定时任务,每 3 分钟采集一次,保存日志 24h)
通过 Ansible/Shell 脚本 SSH 批量登录所有交换机,循环执行并写入日志:
bash
# 采集环网STP阻塞端口
display stp brief
# 查看各Trunk带宽占用
display interface GigabitEthernet 1/0/25
# 查看核心CPU
display cpu
# 查看在线认证用户(iNode环境)
display access-user
2)人工辅助巡检
白天业务高峰(9:00、14:30、晚高峰 19 点)各登录一次核心,查看环网阻塞端口位置不变(正常环网 STP 阻塞口固定,频繁漂移代表环路 / 链路抖动);
手动 shutdown 环网其中一条备用链路,测试冗余倒换:
断掉冗余链路后,观察:
STP 阻塞端口正常切换;
终端、iNode 用户不会掉线;
业务系统、办公系统无卡顿中断。
测试完成恢复链路,观察链路恢复收敛是否平稳。
方式 3:业务层面在线率监测(验证上层业务是否稳定)
办公:持续 ping 网关、OA 服务器、DNS 服务器,长 ping 24 小时记录丢包率;
校园 / 企业内网:统计 EIA iNode 在线人数曲线,正常工作日曲线规律平稳;如果随机大批量用户掉线,代表现有网络存在隐性故障;
关键业务(数据库、生产系统):对接业务运维确认 24h 内无业务卡顿、断连报错。
三、必须重点观测的 2 个关键点(对应原文两句要求)
1、全路网流量监测
拿到 24 小时流量报表,区分闲时、忙时带宽基线。
作用:割接新核心后,可以对比新旧核心同一时段流量曲线,如果曲线一致,代表割接无误;如果新核心链路带宽跑满,提前扩容。
2、确认原有环网冗余链路正常
环网冗余正常的判定标准:
任意断掉环网其中一条链路,全网无断网、无大面积用户下线;
STP 阻塞端口只会发生一次正常切换,不会反复震荡;
链路恢复后,网络收敛平稳,不会产生广播风暴。
如果测试断链路后出现用户掉线、业务卡顿,说明旧环网本身有缺陷(STP 配置错误、链路质量差、双根桥等),必须先修复旧网络,再进行核心割接,否则割接极易故障。
四、完整 24 小时监测执行流程
0 时刻:开启所有性能采集、日志记录、长 ping 探测;记录初始 STP 拓扑、环网阻塞端口位置;
全天安排运维值守,出现批量掉线、链路闪断、CPU 冲高立即排查旧网故障并修复;
白天早晚高峰重点盯在线人数、带宽;
第 24 小时结束:
① 导出全天流量、在线用户报表;
② 做一次冗余破坏性测试:断开环网备用链路,验证倒换;
③ 链路复原,确认拓扑恢复正常;
结论:
24h 无异常、冗余倒换正常 → 具备割接条件;
旧网频繁抖动、断链路业务中断 → 先整改旧网络,暂缓割接。
五、补充割接行业惯例
24 小时监测本质是规避背锅:证明割接前原有网络是健康的,后续割接出问题,可以区分是旧网原有隐患还是新核心配置问题;
环网场景最容易踩坑:旧环网长期运行出现 STP 漂移、隐性环路,割接替换核心时叠加拓扑变更,极易全网风暴瘫痪,所以必须提前验证冗余。
六、极简总结
用 iMC / 脚本连续采集 24h:流量、CPU、在线用户、STP 拓扑;
中途做一次断冗余链路测试,验证环网倒换是否正常;
全天无抖动、冗余切换无损业务,才允许替换新旧核心交换机。
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论