以下是排查Prometheus进程不断重启及监控数据丢失的关键命令:
1. 查看容器日志(最直接方法):
docker logs -f prometheus-cluster
检查是否有配置文件错误、数据目录损坏或端口冲突信息。
2. 查看容器状态:
docker ps -a | grep prometheus
查看容器是否处于 Restarting 状态及退出代码(Exit Code)。
3. 检查资源占用:
docker stats
确认是否因内存溢出(OOM)导致进程被Kill。
4. 检查Prometheus配置文件:
通常位于 /var/lib/docker/volumes/.../_data/prometheus.yml 或 H3C超融合特定目录。
验证配置语法(可在本地使用 promtool check config)。
5. 检查系统日志:
dmesg -T | grep -i oom
journalctl -u docker.service
建议操作:如果是测试环境且数据不重要,可尝试删除并重新拉取容器,或联系H3C技术支持获取特定版本的诊断脚本。
暂无评论