排查步骤如下:
1. 检查Bond状态与模式
cat /proc/net/bonding/bondX:确认Bond模式(如mode4需确认对端LACP配置)、活跃端口、配置参数(如miimon/arp_interval),同时确认是否发生过端口切换。
2. 排查Overlay网络(如Calico/Flannel)
ip addr / ip link:检查VTEP设备(如tunl0/cali*)状态与MTU。
calicoctl node status(Calico):检查BGP Peer状态。
抓包分析:tcpdump -i bondX -w /tmp/bond.pcap,同时在Pod内ping对端,确认丢包点在物理网络还是Overlay。
3. 检查Kubernetes与CLOUDOS组件
kubectl describe node :检查节点状态、资源压力(DiskPressure/MemoryPressure)。
systemctl status kubelet / journalctl -u kubelet -f:检查Kubelet日志。
登录CLOUDOS Portal,查看“监控告警”->“主机监控”,确认该节点CPU/内存/存储使用率。
4. 排查硬件与OVS
ovs-ofctl dump-ports br-int / ovs-appctl bond/show (如果使用OVS)。
ethtool :确认物理口速率/双工模式,是否自协商异常。
尝试更换光模块/光纤/交换机端口。
ping 都正常,硬件也没问题,不知道esight一直在报网络异常