问题描述
S7500XG-7764(S7500XG-7764版本)Portal认证迁移致httpredrd进程CPU利用率飙升
过程分析
- 现象描述:约100个用户迁移至S7500XG-7764设备后,Slot 2的httpredrd(重定向进程)CPU利用率升高至33.5%(峰值40.1%),设备产生大量SOCKET/6/SOCKET_TCP_UNREAD日志,显示TCP数据在接收缓冲区滞留34秒未被读取,Owner均为httpredrd,涉及多个客户端IP(如111.63.96.52、183.215.57.92等)与Portal服务器192.168.254.1的6654端口通信
- 触发条件:用户迁移操作,约100多个终端同时或短时间内迁移到该设备下接入
- 持续时间:邮件未明确提及具体持续时长,日志产生于2026年7月8日10:55:18至10:55:19期间,后续观察日志消失、CPU利用率恢复正常
- 现象特征:httpredrd进程CPU占用高,进程堆栈跟踪显示大量RSA签名(RSA_sign)、EVP_SignFinal、ssl3_send_server_key_exchange、ssl3_accept、ssl23_accept等SSL握手相关计算操作,表明处于SSL/TLS密钥交换阶段;同时Slot 2 Portal认证报文上送CPU队列达440pps
解决方法
-
排查思路
- 从CPU利用率告警入手,通过process命令定位高CPU进程为httpredrd(PID 1606),CPU占用33.5%
- 搜索SOCKET_TCP_UNREAD日志,确认Owner均为httpredrd,关联Portal认证重定向功能
- 使用follow job命令对httpredrd进程进行堆栈跟踪,分析其CPU消耗所在
- 检查Slot 2 Portal认证报文上送CPU队列,确认有440pps的报文量
- 结合板卡硬件信息(Slot 2为LSCM2GP48SC0,CPU为双核ARM),分析性能瓶颈
- 最终根因:用户迁移时约100多个终端同时接入设备,部分终端保持连接未第一时间触发Portal认证,这些未认证终端的访问请求被httpredrd重定向至Portal服务器(192.168.254.1:80/portal/)httpredrd在处理SSL重定向时需要进行SSL握手(RSA签名、椭圆曲线运算等),大量并发SSL握手请求导致双核ARM CPU算力不足,CPU利用率飙升;随着用户逐步完成认证或连接超时断开,SOCKET日志消失,CPU利用率恢复正常