Senario
Platform e-dagang anda berjalan di Kubernetes. Pengguna melaporkan proses pembayaran lambat. Pasukan SRE melihat lonjakan kependaman P99 dari 200ms ke 2s, tetapi CPU dan memori normal. Jejak OpenTelemetry menunjukkan rentang pangkalan data hilang.
Gejala
- Papan pemuka Grafana menunjukkan kependaman P99 tinggi.
- Metrik Prometheus http_request_duration_seconds meningkat, tetapi node_cpu_seconds_total kekal.
- Jejak tidak lengkap—rentang pangkalan data tiada.
- Tiada log ralat.
Diagnosis
- Periksa konfigurasi OpenTelemetry Collector: Konfigurasi kekurangan pemproses batch, menyebabkan kelewatan hantar rentang.
- Sahkan sasaran Prometheus scrape: Pastikan titik metrik collector dikikis.
- Periksa log Collector: Jalankan
kubectl logs <otel-collector-pod>. Lihat tamat masa dan cubaan semula.
Arahan
Sandaran konfigurasi semasa
kubectl get configmap otel-collector-config -o yaml > otel-collector-config.bak.yaml
Kemas kini dan gunakan konfigurasi baru
Tambah pemproses batch:
processors:
batch:
timeout: 5s
send_batch_size: 1000
Gunakan:
kubectl apply -f otel-collector-config.yaml
kubectl rollout restart deployment otel-collector
Sahkan sasaran Prometheus
kubectl port-forward svc/otel-collector 8888
curl http://localhost:8888/metrics | grep otel
Kawalan Risiko
- Uji perubahan konfigurasi di persekitaran pementasan dahulu.
- Gunakan strategi biru/hijau untuk kemas kini collector.
- Sandarkan ConfigMap dan Deployment semasa.
- Pantau penggunaan sumber collector untuk elakkan OOM.
Balik Pulih
Jika masalah timbul, balik pulih segera:
kubectl apply -f otel-collector-config.bak.yaml
kubectl rollout restart deployment otel-collector
Pengesahan
- Periksa Grafana: Kependaman P99 harus menurun.2. Jejak OpenTelemetry kini menunjukkan rentang pangkalan data.3. Jalankan PromQL:
histogram_quantile(0.99, rate(http_request_duration_seconds_bucket[5m])).
Bila Hantar Tiket OpsGlobal
- Isu masih berterusan selepas semua langkah.2. Metrik atau jejak teras hilang sepenuhnya.3. Perlukan bantuan mengoptimumkan prestasi atau konfigurasi collector.4. Syak ada hambatan infrastruktur yang tidak diketahui.
Senario Penggunaan
Sesuai untuk pasukan yang menyelesaikan isu Observability dan memerlukan aliran kerja yang jelas.
Latar Belakang Masalah
Post ini membimbing senario sebenar mendiagnosis metrik dan jejak yang hilang dalam persekitaran Kubernetes menggunakan Prometheus, Grafana, dan OpenTelemetry, lengkap dengan langkah-langkah dan kawalan risiko.
Langkah Penyelesaian
Sahkan impak dan perubahan terkini, kumpul log, konfigurasi dan metrik, kemudian baiki mengikut risiko.
Contoh Arahan
Gantikan contoh dengan nama sumber sebenar dan simpan kata laluan, token atau kunci dalam pembolehubah persekitaran.
Risiko
Sebelum operasi produksi, semak sandaran, akses, tetingkap perubahan dan pelan rollback.
Pelan Rollback
Simpan konfigurasi dan versi asal; rollback konfigurasi, imej atau perubahan pangkalan data jika metrik tidak normal.
Senarai Serahan
Rekod punca isu, arahan penting, langkah pembaikan, hasil pengesahan dan cadangan susulan.
Perlu bantuan isu teknikal serupa?
Jika pelayan, Kubernetes, Docker, CI/CD, pangkalan data atau pemantauan anda bermasalah, hantar log dan konfigurasi untuk diagnosis jauh.