预约咨询 提交工单

Prometheus+Grafana+OpenTelemetry可观测性故障排查实战

基于Prometheus、Grafana和OpenTelemetry构建的可观测性栈中,遇到指标缺失或链路丢失时的实用排查指南。

Prometheus+Grafana+OpenTelemetry可观测性故障排查实战
Observability 6min 59 浏览 2026-06-24
PrometheusGrafanaOpenTelemetryKubernetesSRE

场景

你的Kubernetes集群上运行着微服务应用,使用OpenTelemetry收集链路、指标和日志,Prometheus存储指标,Grafana展示仪表盘。突然,Grafana面板出现空白或数据断层,告警不触发。

症状

  • Grafana仪表盘上某些面板显示“No data”或时间序列有缺口
  • Prometheus Target页面显示某些target down或状态异常
  • OpenTelemetry Collector日志出现错误或警告
  • 链路追踪(Trace)在Jaeger或Grafana Tempo中不完整

诊断步骤

1. 检查Prometheus Target状态

kubectl port-forward svc/prometheus-server 9090:80 -n monitoring
# 浏览器访问 http://localhost:9090/targets

查看有哪些target处于DOWN状态。常见原因:服务已缩容但Prometheus未更新,或RBAC/网络策略阻止抓取。

2. 验证OpenTelemetry Collector

kubectl logs -l app=otel-collector -n observability --tail=200 | grep -i error

检查Collector是否成功将指标推送到Prometheus(或通过Prometheus远程写入端点)。常见错误:配置中的端点不可达、认证失败、数据格式不匹配。

3. 检查网络策略

确保Prometheus服务器能访问所有目标Pod的/metrics端口,以及Collector能访问后端(如Jaeger、Tempo)。

风险控制

  • 修改配置前备份当前配置:kubectl get configmap -n monitoring prometheus-server -o yaml > prom-config-backup.yaml
  • 避免在高峰期变更采集间隔或保留策略
  • 先在一个非关键命名空间测试更改

回滚步骤

如果修改后问题恶化,恢复备份配置:

kubectl apply -f prom-config-backup.yaml -n monitoring
kubectl rollout restart deployment prometheus-server -n monitoring

对于OpenTelemetry Collector,同样回滚ConfigMap并重启Pod。

验证

  • 确认Prometheus Target全部UP:http://localhost:9090/targets
  • 在Grafana中查询最新指标(例如uphttp_requests_total
  • 检查Collector日志无报错

何时提交OpsGlobal工单

完成以上步骤后问题仍存在,或涉及以下情况时,立即提交工单: - Prometheus或Collector Pod持续CrashLoopBackOff - 关键业务路径的指标完全丢失超过10分钟 - 需要调整Prometheus的持久化存储设置或扩容

我们的SRE团队将快速介入,最小化对业务的影响。

适用场景

适合正在处理 Observability、Prometheus, Grafana, OpenTelemetry, Kubernetes 相关问题的团队,用于快速建立排查路径和交付标准。

问题背景

基于Prometheus、Grafana和OpenTelemetry构建的可观测性栈中,遇到指标缺失或链路丢失时的实用排查指南。

排查步骤

先确认影响范围和最近变更,再收集日志、配置、指标和链路数据,最后按风险从低到高执行修复。

命令示例

示例命令请替换为你的真实资源名,并使用环境变量保存账号、密码、token 等敏感信息。

风险说明

生产环境操作前需要确认备份、权限边界、变更窗口和回滚路径,避免扩大故障影响。

回滚方案

保留原配置和发布版本;如修复后指标异常,立即回退配置、镜像或数据库变更并复核日志。

交付清单

问题定位记录、关键命令、修复步骤、验证结果、后续优化建议。

!

遇到类似技术问题?

如果你的服务器、K8s、Docker、CI/CD、数据库或监控系统出现类似问题,可以提交日志和配置文件,我们帮你远程诊断。

工单 WhatsApp 联系 咨询