Tempah Konsultasi Hantar Tiket

Penyelesaian Masalah Pemerhatian Prometheus+Grafana dengan OpenTelemetry

Panduan praktikal untuk mendiagnosis metrik dan jejak yang hilang dalam timbunan pemerhatian yang dibina dengan Prometheus, Grafana, dan OpenTelemetry di Kubernetes.

Penyelesaian Masalah Pemerhatian Prometheus+Grafana dengan OpenTelemetry
Observability 6min 60 paparan 2026-06-24
PrometheusGrafanaOpenTelemetryKubernetesSRE

Senario

Anda mempunyai aplikasi mikroservis di Kubernetes yang menggunakan OpenTelemetry untuk jejak, metrik, dan log. Prometheus mengumpul metrik, dan Grafana memaparkannya. Tiba-tiba, papan pemuka Grafana menunjukkan jurang atau tiada data, dan penggera berhenti berfungsi.

Gejala

  • Panel Grafana memaparkan “Tiada data” atau siri masa hilang
  • Halaman sasaran Prometheus menunjukkan beberapa sasaran sebagai DOWN
  • Log Pengumpul OpenTelemetry menunjukkan ralat atau amaran
  • Jejak di Jaeger atau Tempo tidak lengkap

Diagnosis

1. Periksa Sasaran Prometheus

kubectl port-forward svc/prometheus-server 9090:80 -n monitoring
# Lawati http://localhost:9090/targets

Cari sasaran DOWN. Punca biasa: pod dikecilkan, RBAC atau dasar rangkaian menyekat pengambilan.

2. Periksa Pengumpul OpenTelemetry

kubectl logs -l app=otel-collector -n observability --tail=200 | grep -i error

Pastikan pengumpul menghantar metrik ke Prometheus (atau melalui tulis jauh). Ralat: titik akhir tidak dapat dicapai, kegagalan pengesahan, format data tidak sepadan.

3. Dasar Rangkaian

Pastikan Prometheus boleh mengakses /metrics pada semua pod sasaran, dan pengumpul boleh mencapai backend (Jaeger, Tempo).

Kawalan Risiko

  • Sandarkan konfigurasi sebelum perubahan: kubectl get configmap -n monitoring prometheus-server -o yaml > prom-config-backup.yaml
  • Elakkan perubahan pada waktu puncak
  • Uji perubahan dalam namespace bukan kritikal terlebih dahulu

Langkah Balik

Jika masalah bertambah buruk selepas perubahan, pulihkan sandaran:

kubectl apply -f prom-config-backup.yaml -n monitoring
kubectl rollout restart deployment prometheus-server -n monitoring

Untuk Pengumpul OpenTelemetry, balikkan ConfigMap dan mulakan semula pod.

Pengesahan

  • Sahkan semua sasaran Prometheus UP: http://localhost:9090/targets
  • Query metrik terkini di Grafana (contohnya up, http_requests_total)
  • Periksa log pengumpul tiada ralat

Bila Serahkan Tiket OpsGlobal

Serahkan tiket jika: - Pod Prometheus atau pengumpul berada dalam CrashLoopBackOff - Metrik kritikal hilang selama lebih 10 minit - Anda memerlukan bantuan untuk menyesuaikan atau meningkatkan storan kekal

Pasukan SRE kami akan campur tangan dengan cepat untuk meminimumkan kesan perniagaan.

Senario Penggunaan

Sesuai untuk pasukan yang menyelesaikan isu Observability dan memerlukan aliran kerja yang jelas.

Latar Belakang Masalah

Panduan praktikal untuk mendiagnosis metrik dan jejak yang hilang dalam timbunan pemerhatian yang dibina dengan Prometheus, Grafana, dan OpenTelemetry di Kubernetes.

Langkah Penyelesaian

Sahkan impak dan perubahan terkini, kumpul log, konfigurasi dan metrik, kemudian baiki mengikut risiko.

Contoh Arahan

Gantikan contoh dengan nama sumber sebenar dan simpan kata laluan, token atau kunci dalam pembolehubah persekitaran.

Risiko

Sebelum operasi produksi, semak sandaran, akses, tetingkap perubahan dan pelan rollback.

Pelan Rollback

Simpan konfigurasi dan versi asal; rollback konfigurasi, imej atau perubahan pangkalan data jika metrik tidak normal.

Senarai Serahan

Rekod punca isu, arahan penting, langkah pembaikan, hasil pengesahan dan cadangan susulan.

!

Perlu bantuan isu teknikal serupa?

Jika pelayan, Kubernetes, Docker, CI/CD, pangkalan data atau pemantauan anda bermasalah, hantar log dan konfigurasi untuk diagnosis jauh.

Tiket Hubungi WhatsApp Konsultasi