itoa‑health‑analysis Pod 反复重启itoa‑health‑analysis是 SeerAnalyzer 分析器组件,负责设备健康指标计算、告警生成;反复重启一般为:OOM 内存溢出、依赖服务(kafka/elasticsearch/itoa‑db)连接失败、持久卷异常、探针误杀、版本 BUGKubernetes。
登录统一数字底盘 Oasis 节点执行 kubectl,命名空间一般为itoa。
#查看pod事件,看退出原因:OOMKilled / Liveness probe failed / ExitCode
kubectl describe pod itoa‑health‑analysis‑xxx -n itoa
#重点!查看上一次崩溃的日志(--previous,没有这条看不到崩溃栈)
kubectl logs itoa‑health‑analysis‑xxx -n itoa --previous
#查看当前实时日志
kubectl logs -f itoa‑health‑analysis‑xxx -n itoa
#查看pod资源实际消耗
kubectl top pod itoa‑health‑analysis‑xxx -n itoa
connect refused / timeout:连不上 kafka、elasticsearch、itoa‑db,依赖 pod 异常。itoa‑health‑analysis做健康计算,设备多、指标多,内存会明显上涨,超出 yaml 里 limit,直接 OOMkill,循环重启。itoa‑db、kafka、elasticsearch pod 异常未就绪,本 pod 启动连接失败直接退出。itoa‑health‑analysis存在内存泄漏 BUG。kubectl get pods -n itoa
itoa‑db、kafka、elasticsearch、itoa‑collector状态 Running,无 CrashLoopBackOff。只要依赖组件异常,health‑analysis 就会反复重启。df -h
删除 pod,deployment 控制器会自动重建 pod:
kubectl delete pod itoa‑health‑analysis‑xxxx -n itoa
如果删除后依旧反复重启,需要定位根因,单纯删除 pod 治标不治本。
kubectl get deployment itoa‑health‑analysis -n itoa -o yaml
resources.limits.memory。设备数量多(>100 台),默认内存配额不够,需要调高 limit 内存。 ⚠️不要直接手动改 yaml,AD‑Campus 统一数字底盘 Web 界面修改 SeerAnalyzer 实例资源规格,修改后 pod 自动重建生效,直接 kubectl edit 会被底盘覆盖。
Web 路径:统一数字底盘 →应用管理→SeerAnalyzer 实例→编辑实例资源,调高itoa‑health‑analysis内存限制。
itoa‑health‑analysis自动恢复。Liveness probe failed,应用启动慢探针超时。不要直接 kubectl edit 修改探针,在统一数字底盘 web 修改实例参数,调大存活探针初始延迟、超时时间。
itoa‑health‑analysis存在内存泄漏已知问题,设备多会持续涨内存 OOM;需要升级到对应版本最新补丁。kubectl logs xxx --previous > health.log)提交 H3C TAC 分析。kubectl describe pod itoa‑health‑analysis‑xxx -n itoa输出kubectl logs podname -n itoa --previous崩溃日志kubectl get pods -n itoa全部 pod 状态df -h磁盘信息
亲~登录后才可以操作哦!
确定你的邮箱还未认证,请认证邮箱或绑定手机后进行当前操作
举报
×
侵犯我的权益
×
侵犯了我企业的权益
×
抄袭了我的内容
×
原文链接或出处
诽谤我
×
对根叔社区有害的内容
×
不规范转载
×
举报说明
......