• 全部
  • 经验案例
  • 典型配置
  • 技术公告
  • FAQ
  • 漏洞说明
  • 全部
  • 全部
  • 大数据引擎
  • 知了引擎
产品线
搜索
取消
案例类型
发布者
是否解决
是否官方
时间
搜索引擎
匹配模式
高级搜索

X10536 G3分布式存储连接的6520X交换机,流量大了就提示丢包?

11小时前提问
  • 0关注
  • 0收藏,40浏览
粉丝:0人 关注:0人

问题描述:

X10536 G3分布式存储连接的6520X交换机,流量大了就提示丢包?交换机应该如何设置?

3 个回答
粉丝:9人 关注:46人

做链路聚合

暂无评论

粉丝:23人 关注:2人

核心前置判断
X10536 G3 分布式存储集群内部流量、业务读写流量属于高吞吐、强突发业务;S6520X 默认缓存、QoS 参数对存储业务不友好,流量冲高后端口队列打满产生尾部丢弃,存储侧上报丢包。
先区分:
如果是RDMA/RoCE 块存储:需要 PFC 无损网络;
如果是普通 TCP 业务(文件 / NFS/iSCSI):不需要 PFC,重点优化 MTU、缓存、队列、流控。
第一步:先执行定位命令,确认丢包根源
plaintext
# 查看端口是否存在队列丢弃(最关键)
display qos queue-statistics interface Ten-GigabitEthernet 1/0/X
# 查看端口统计,确认Discard计数
display interface Ten-GigabitEthernet 1/0/X
# 查看缓冲区状态
display buffer
# 查看接口协商速率、双工
display transceiver interface Ten-GigabitEthernet 1/0/X
若Discarded Packets持续增长 = 交换机出方向队列拥塞丢包(存储场景 90% 都是这个现象)
第二步:基础标准化配置(所有存储对接端口必配)
1. MTU 巨帧(X10000 推荐)
X10536 G3 节点网卡 MTU 建议 9000,交换机接口同步开启巨帧
plaintext
system-view
interface Ten-GigabitEthernet 1/0/X
port link-mode route
# 开启巨帧,9000字节
jumboframe enable 9000
# 关闭不必要功能
undo stp enable
undo lldp enable
# 关闭风暴抑制(默认风暴抑制会误丢存储突发流量)
undo storm-constrain broadcast
undo storm-constrain multicast
undo storm-constrain unicast
⚠️ 整条链路(交换机 ↔ 存储主机网卡)MTU 必须统一,否则分片引发性能暴跌、伪丢包。
2. 缓存优化(解决突发流量,S6520X 核心优化点)
开启 Burst 自动缓存分配(官方推荐用于存储突发业务)
plaintext
system-view
burst-mode enable
burst-mode 开启后,交换机会动态调度共享 Buffer,应对存储瞬时大流量冲击;不要同时手动配置 buffer cell 参数,二者互斥。
3. 端口流控(普通 TCP 存储场景建议)
❗【重要区分】
普通 TCP (iSCSI/NFS/ 文件存储):使用端口流控(802.3x)
RoCE/RDMA 块存储:使用PFC 优先级流控,不要开启普通端口流控
TCP 场景配置示例:
plaintext
interface Ten-GigabitEthernet 1/0/X
flow-control enable
4. QoS 队列优化(避免 BE 队列尾部丢弃)
存储流量默认进入队列 0(BE 最低优先级),拥塞时最先丢包。两种方案可选:
方案 A(简单推荐):信任优先级,存储流量打上高优先级
plaintext
# 接口下信任802.1p
interface Ten-GigabitEthernet 1/0/X
qos trust dot1p
然后在 X10536 服务器网卡侧配置 VLAN 优先级,将存储流量映射到高队列;
方案 B(不打标签场景):本地重标记存储流量
通过 ACL 匹配存储网段,重标记本地优先级,放入更高调度队列。
队列调度模式
S6520X 默认 SP 严格优先级,高优先级流量会饿死低优先级;存储混合业务建议使用 WRR 调度:
plaintext
interface Ten-GigabitEthernet 1/0/X
qos wrr weight
第三步:两种业务场景完整区分配置
场景 A:普通 TCP 业务(iSCSI/NFS/ 文件存储,绝大多数现场)
✅ 禁止配置 PFC! 错误开启 PFC 极易产生拥塞死锁,引发全网吞吐暴跌
完整端口模板:
plaintext
system-view
burst-mode enable
interface Ten-GigabitEthernet 1/0/X
port link-mode route
jumboframe enable 9000
flow-control enable
undo stp enable
undo storm-constrain broadcast
undo storm-constrain multicast
undo storm-constrain unicast
qos wrr weight
场景 B:RoCEv2 / RDMA 块存储(需要无损网络)
必须全线所有交换机接口统一配置 PFC,X10536 网卡同步开启 RoCE
plaintext
system-view
priority-flow-control enable
priority-flow-control no-drop dot1p 3
burst-mode enable
interface Ten-GigabitEthernet 1/0/X
port link-mode route
jumboframe enable 9000
priority-flow-control enable
priority-flow-control priority 3
undo stp enable
undo storm-constrain all
qos wrr weight
第四步:组网层面优化建议(软件配置解决不了时)
检查单端口带宽瓶颈
多个存储节点流量收敛到单条上联,极易出现多对一拥塞,建议使用Eth-Trunk 链路聚合分担负载;
负载分担策略
存储集群链路聚合推荐:load-balance source-dest-mac 或者 source-dest-ip,避免哈希不均导致单端口过载;
plaintext
link-aggregation load-balance mode source-destination ip
光模块与链路检查
使用 H3C 认证光模块,非兼容光模块高负载下出现 CRC 错包,表现为 “流量大才丢包”;查看display interface是否存在 CRC 错误。
第五步:存储侧配套核查(网络优化后仍丢包时)
X10536 G3 节点网卡中断聚合、网卡缓冲区调优;
确认集群内部副本流量、恢复流量是否抢占业务带宽;
区分丢包是集群内部节点间流量,还是客户端访问存储流量,定位故障链路。
最简排查顺序总结
display qos queue-statistics确认是否交换机队列丢弃
统一整条链路 MTU=9000,开启 jumboframe
全局开启burst-mode enable
存储接口关闭风暴抑制、STP
TCP 场景开启 flow-control;RDMA 场景部署 PFC
收敛流量过大时部署 Eth-Trunk 分担压力

暂无评论

粉丝:26人 关注:1人

针对X10536 G3分布式存储连接6520X交换机在流量大时丢包的问题,这通常是网络瞬时拥塞导致的缓存丢包。可以参考以下步骤进行排查和优化。

🛠️ 第一步:基础物理与配置检查

在调整复杂配置前,先排除物理层和基础配置问题。

  • 物理链路检查:检查光模块、光纤或网线是否存在质量或兼容性问题,信号不稳是导致端口震荡或丢包的常见原因

  • 端口配置检查:确认交换机端口与存储服务器端口的速率、双工模式、MTU(建议设为9216巨型帧) 等设置完全一致

  • 查看端口状态:通过 display interface 命令检查端口下是否有CRC错误、drop计数等异常

  • 聚合配置检查:若使用动态聚合,确认存储侧绑定模式与交换机侧配置匹配。

  • 生成树(STP)检查:检查端口的STP状态是否正常,避免因协议计算导致端口异常阻塞

⚙️ 第二步:核心配置优化

如果基础检查正常,问题很可能在于交换机缓存不足,可以尝试以下配置:

  • 开启Burst Mode(推荐优先尝试)
    这是最直接的解决方式,能有效应对瞬间突发流量。在系统视图下执行:

    text
    <Sysname> system-view [Sysname] burst-mode enable slot slot-number

    slot-number需替换为接口板所在槽位号

    开启后,交换机会自动分配缓冲区以应对突发流量,显著降低丢包率

  • 开启接口流量控制(Flow Control)
    在连接存储的所有接口上开启,让拥塞时设备能通知对端暂停发送,实现端到端流控

    text
    <Sysname> system-view [Sysname] interface ten-gigabitethernet 1/0/1 [Sysname-Ten-GigabitEthernet1/0/1] flow-control

    注意:需要链路两端(交换机和存储网卡)都开启此功能才能生效

  • 启用PFC(优先级流控制)
    如果业务对丢包极其敏感(如使用RoCE等无损网络需求),可考虑配置PFC。它比全局流控更精细,能为特定类型流量提供“无损”通道。

    注意:PFC配置复杂,需结合具体业务规划,且不能与全局flow-control命令同时配置

🔍 第三步:进一步排查方向

如果以上配置无效,可以从以下方向排查:

  • 检查日志与告警阈值:分析日志中的丢包信息,判断是否为瞬时超标,必要时可调整接口监控阈值

  • 确认是否为误报:如存储侧业务正常且无丢包记录,可能是交换机监控策略过于敏感

  • 升级软件版本:检查是否存在已知的丢包Bug,部分旧版本可能存在此类问题

  • 排查环路或广播风暴:检查网络二层是否存在环路,或异常广播/组播报文,它们会耗尽交换机资源

暂无评论

编辑答案

你正在编辑答案

如果你要对问题或其他回答进行点评或询问,请使用评论功能。

分享扩散:

提出建议

    +

亲~登录后才可以操作哦!

确定

亲~检测到您登陆的账号未在http://hclhub.h3c.com进行注册

注册后可访问此模块

跳转hclhub

你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作

举报

×

侵犯我的权益 >
对根叔社区有害的内容 >
辱骂、歧视、挑衅等(不友善)

侵犯我的权益

×

泄露了我的隐私 >
侵犯了我企业的权益 >
抄袭了我的内容 >
诽谤我 >
辱骂、歧视、挑衅等(不友善)
骚扰我

泄露了我的隐私

×

您好,当您发现根叔知了上有泄漏您隐私的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您认为哪些内容泄露了您的隐私?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)

侵犯了我企业的权益

×

您好,当您发现根叔知了上有关于您企业的造谣与诽谤、商业侵权等内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到 pub.zhiliao@h3c.com 邮箱,我们会在审核后尽快给您答复。
  • 1. 您举报的内容是什么?(请在邮件中列出您举报的内容和链接地址)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
  • 3. 是哪家企业?(营业执照,单位登记证明等证件)
  • 4. 您与该企业的关系是?(您是企业法人或被授权人,需提供企业委托授权书)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

抄袭了我的内容

×

原文链接或出处

诽谤我

×

您好,当您发现根叔知了上有诽谤您的内容时,您可以向根叔知了进行举报。 请您把以下内容通过邮件发送到pub.zhiliao@h3c.com 邮箱,我们会尽快处理。
  • 1. 您举报的内容以及侵犯了您什么权益?(请在邮件中列出您举报的内容、链接地址,并给出简短的说明)
  • 2. 您是谁?(身份证明材料,可以是身份证或护照等证件)
我们认为知名企业应该坦然接受公众讨论,对于答案中不准确的部分,我们欢迎您以正式或非正式身份在根叔知了上进行澄清。

对根叔社区有害的内容

×

垃圾广告信息
色情、暴力、血腥等违反法律法规的内容
政治敏感
不规范转载 >
辱骂、歧视、挑衅等(不友善)
骚扰我
诱导投票

不规范转载

×

举报说明