Senario
Anda mempunyai aplikasi mikroservis di Kubernetes yang menggunakan OpenTelemetry untuk jejak, metrik, dan log. Prometheus mengumpul metrik, dan Grafana memaparkannya. Tiba-tiba, papan pemuka Grafana menunjukkan jurang atau tiada data, dan penggera berhenti berfungsi.
Gejala
- Panel Grafana memaparkan “Tiada data” atau siri masa hilang
- Halaman sasaran Prometheus menunjukkan beberapa sasaran sebagai DOWN
- Log Pengumpul OpenTelemetry menunjukkan ralat atau amaran
- Jejak di Jaeger atau Tempo tidak lengkap
Diagnosis
1. Periksa Sasaran Prometheus
kubectl port-forward svc/prometheus-server 9090:80 -n monitoring
# Lawati http://localhost:9090/targets
Cari sasaran DOWN. Punca biasa: pod dikecilkan, RBAC atau dasar rangkaian menyekat pengambilan.
2. Periksa Pengumpul OpenTelemetry
kubectl logs -l app=otel-collector -n observability --tail=200 | grep -i error
Pastikan pengumpul menghantar metrik ke Prometheus (atau melalui tulis jauh). Ralat: titik akhir tidak dapat dicapai, kegagalan pengesahan, format data tidak sepadan.
3. Dasar Rangkaian
Pastikan Prometheus boleh mengakses /metrics pada semua pod sasaran, dan pengumpul boleh mencapai backend (Jaeger, Tempo).
Kawalan Risiko
- Sandarkan konfigurasi sebelum perubahan:
kubectl get configmap -n monitoring prometheus-server -o yaml > prom-config-backup.yaml - Elakkan perubahan pada waktu puncak
- Uji perubahan dalam namespace bukan kritikal terlebih dahulu
Langkah Balik
Jika masalah bertambah buruk selepas perubahan, pulihkan sandaran:
kubectl apply -f prom-config-backup.yaml -n monitoring
kubectl rollout restart deployment prometheus-server -n monitoring
Untuk Pengumpul OpenTelemetry, balikkan ConfigMap dan mulakan semula pod.
Pengesahan
- Sahkan semua sasaran Prometheus UP:
http://localhost:9090/targets - Query metrik terkini di Grafana (contohnya
up,http_requests_total) - Periksa log pengumpul tiada ralat
Bila Serahkan Tiket OpsGlobal
Serahkan tiket jika: - Pod Prometheus atau pengumpul berada dalam CrashLoopBackOff - Metrik kritikal hilang selama lebih 10 minit - Anda memerlukan bantuan untuk menyesuaikan atau meningkatkan storan kekal
Pasukan SRE kami akan campur tangan dengan cepat untuk meminimumkan kesan perniagaan.
Senario Penggunaan
Sesuai untuk pasukan yang menyelesaikan isu Observability dan memerlukan aliran kerja yang jelas.
Latar Belakang Masalah
Panduan praktikal untuk mendiagnosis metrik dan jejak yang hilang dalam timbunan pemerhatian yang dibina dengan Prometheus, Grafana, dan OpenTelemetry di Kubernetes.
Langkah Penyelesaian
Sahkan impak dan perubahan terkini, kumpul log, konfigurasi dan metrik, kemudian baiki mengikut risiko.
Contoh Arahan
Gantikan contoh dengan nama sumber sebenar dan simpan kata laluan, token atau kunci dalam pembolehubah persekitaran.
Risiko
Sebelum operasi produksi, semak sandaran, akses, tetingkap perubahan dan pelan rollback.
Pelan Rollback
Simpan konfigurasi dan versi asal; rollback konfigurasi, imej atau perubahan pangkalan data jika metrik tidak normal.
Senarai Serahan
Rekod punca isu, arahan penting, langkah pembaikan, hasil pengesahan dan cadangan susulan.
Perlu bantuan isu teknikal serupa?
Jika pelayan, Kubernetes, Docker, CI/CD, pangkalan data atau pemantauan anda bermasalah, hantar log dan konfigurasi untuk diagnosis jauh.