核心前置判断
X10536 G3 分布式存储集群内部流量、业务读写流量属于高吞吐、强突发业务;S6520X 默认缓存、QoS 参数对存储业务不友好,流量冲高后端口队列打满产生尾部丢弃,存储侧上报丢包。
先区分:
如果是RDMA/RoCE 块存储:需要 PFC 无损网络;
如果是普通 TCP 业务(文件 / NFS/iSCSI):不需要 PFC,重点优化 MTU、缓存、队列、流控。
第一步:先执行定位命令,确认丢包根源
plaintext
# 查看端口是否存在队列丢弃(最关键)
display qos queue-statistics interface Ten-GigabitEthernet 1/0/X
# 查看端口统计,确认Discard计数
display interface Ten-GigabitEthernet 1/0/X
# 查看缓冲区状态
display buffer
# 查看接口协商速率、双工
display transceiver interface Ten-GigabitEthernet 1/0/X
若Discarded Packets持续增长 = 交换机出方向队列拥塞丢包(存储场景 90% 都是这个现象)
第二步:基础标准化配置(所有存储对接端口必配)
1. MTU 巨帧(X10000 推荐)
X10536 G3 节点网卡 MTU 建议 9000,交换机接口同步开启巨帧
plaintext
system-view
interface Ten-GigabitEthernet 1/0/X
port link-mode route
# 开启巨帧,9000字节
jumboframe enable 9000
# 关闭不必要功能
undo stp enable
undo lldp enable
# 关闭风暴抑制(默认风暴抑制会误丢存储突发流量)
undo storm-constrain broadcast
undo storm-constrain multicast
undo storm-constrain unicast
⚠️ 整条链路(交换机 ↔ 存储主机网卡)MTU 必须统一,否则分片引发性能暴跌、伪丢包。
2. 缓存优化(解决突发流量,S6520X 核心优化点)
开启 Burst 自动缓存分配(官方推荐用于存储突发业务)
plaintext
system-view
burst-mode enable
burst-mode 开启后,交换机会动态调度共享 Buffer,应对存储瞬时大流量冲击;不要同时手动配置 buffer cell 参数,二者互斥。
3. 端口流控(普通 TCP 存储场景建议)
❗【重要区分】
普通 TCP (iSCSI/NFS/ 文件存储):使用端口流控(802.3x)
RoCE/RDMA 块存储:使用PFC 优先级流控,不要开启普通端口流控
TCP 场景配置示例:
plaintext
interface Ten-GigabitEthernet 1/0/X
flow-control enable
4. QoS 队列优化(避免 BE 队列尾部丢弃)
存储流量默认进入队列 0(BE 最低优先级),拥塞时最先丢包。两种方案可选:
方案 A(简单推荐):信任优先级,存储流量打上高优先级
plaintext
# 接口下信任802.1p
interface Ten-GigabitEthernet 1/0/X
qos trust dot1p
然后在 X10536 服务器网卡侧配置 VLAN 优先级,将存储流量映射到高队列;
方案 B(不打标签场景):本地重标记存储流量
通过 ACL 匹配存储网段,重标记本地优先级,放入更高调度队列。
队列调度模式
S6520X 默认 SP 严格优先级,高优先级流量会饿死低优先级;存储混合业务建议使用 WRR 调度:
plaintext
interface Ten-GigabitEthernet 1/0/X
qos wrr weight
第三步:两种业务场景完整区分配置
场景 A:普通 TCP 业务(iSCSI/NFS/ 文件存储,绝大多数现场)
✅ 禁止配置 PFC! 错误开启 PFC 极易产生拥塞死锁,引发全网吞吐暴跌
完整端口模板:
plaintext
system-view
burst-mode enable
interface Ten-GigabitEthernet 1/0/X
port link-mode route
jumboframe enable 9000
flow-control enable
undo stp enable
undo storm-constrain broadcast
undo storm-constrain multicast
undo storm-constrain unicast
qos wrr weight
场景 B:RoCEv2 / RDMA 块存储(需要无损网络)
必须全线所有交换机接口统一配置 PFC,X10536 网卡同步开启 RoCE
plaintext
system-view
priority-flow-control enable
priority-flow-control no-drop dot1p 3
burst-mode enable
interface Ten-GigabitEthernet 1/0/X
port link-mode route
jumboframe enable 9000
priority-flow-control enable
priority-flow-control priority 3
undo stp enable
undo storm-constrain all
qos wrr weight
第四步:组网层面优化建议(软件配置解决不了时)
检查单端口带宽瓶颈
多个存储节点流量收敛到单条上联,极易出现多对一拥塞,建议使用Eth-Trunk 链路聚合分担负载;
负载分担策略
存储集群链路聚合推荐:load-balance source-dest-mac 或者 source-dest-ip,避免哈希不均导致单端口过载;
plaintext
link-aggregation load-balance mode source-destination ip
光模块与链路检查
使用 H3C 认证光模块,非兼容光模块高负载下出现 CRC 错包,表现为 “流量大才丢包”;查看display interface是否存在 CRC 错误。
第五步:存储侧配套核查(网络优化后仍丢包时)
X10536 G3 节点网卡中断聚合、网卡缓冲区调优;
确认集群内部副本流量、恢复流量是否抢占业务带宽;
区分丢包是集群内部节点间流量,还是客户端访问存储流量,定位故障链路。
最简排查顺序总结
display qos queue-statistics确认是否交换机队列丢弃
统一整条链路 MTU=9000,开启 jumboframe
全局开启burst-mode enable
存储接口关闭风暴抑制、STP
TCP 场景开启 flow-control;RDMA 场景部署 PFC
收敛流量过大时部署 Eth-Trunk 分担压力
暂无评论
针对X10536 G3分布式存储连接6520X交换机在流量大时丢包的问题,这通常是网络瞬时拥塞导致的缓存丢包。可以参考以下步骤进行排查和优化。
在调整复杂配置前,先排除物理层和基础配置问题。
聚合配置检查:若使用动态聚合,确认存储侧绑定模式与交换机侧配置匹配。
如果基础检查正常,问题很可能在于交换机缓存不足,可以尝试以下配置:
开启Burst Mode(推荐优先尝试)
这是最直接的解决方式,能有效应对瞬间突发流量。在系统视图下执行:
开启接口流量控制(Flow Control)
在连接存储的所有接口上开启,让拥塞时设备能通知对端暂停发送,实现端到端流控。
启用PFC(优先级流控制)
如果业务对丢包极其敏感(如使用RoCE等无损网络需求),可考虑配置PFC。它比全局流控更精细,能为特定类型流量提供“无损”通道。
注意:PFC配置复杂,需结合具体业务规划,且不能与全局
flow-control命令同时配置。
如果以上配置无效,可以从以下方向排查:
暂无评论
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
暂无评论