Tempah Konsultasi Hantar Tiket

Pemerhatian Praktikal dengan Prometheus, Grafana, dan OpenTelemetry

Post ini membimbing senario sebenar mendiagnosis metrik dan jejak yang hilang dalam persekitaran Kubernetes menggunakan Prometheus, Grafana, dan OpenTelemetry, lengkap dengan langkah-langkah dan kawalan risiko.

Pemerhatian Praktikal dengan Prometheus, Grafana, dan OpenTelemetry
Observability 6min 46 paparan 2026-07-10
KubernetesSREPemerhatianPrometheusGrafanaOpenTelemetry

Senario

Platform e-dagang anda berjalan di Kubernetes. Pengguna melaporkan proses pembayaran lambat. Pasukan SRE melihat lonjakan kependaman P99 dari 200ms ke 2s, tetapi CPU dan memori normal. Jejak OpenTelemetry menunjukkan rentang pangkalan data hilang.

Gejala

  • Papan pemuka Grafana menunjukkan kependaman P99 tinggi.
  • Metrik Prometheus http_request_duration_seconds meningkat, tetapi node_cpu_seconds_total kekal.
  • Jejak tidak lengkap—rentang pangkalan data tiada.
  • Tiada log ralat.

Diagnosis

  1. Periksa konfigurasi OpenTelemetry Collector: Konfigurasi kekurangan pemproses batch, menyebabkan kelewatan hantar rentang.
  2. Sahkan sasaran Prometheus scrape: Pastikan titik metrik collector dikikis.
  3. Periksa log Collector: Jalankan kubectl logs <otel-collector-pod>. Lihat tamat masa dan cubaan semula.

Arahan

Sandaran konfigurasi semasa

kubectl get configmap otel-collector-config -o yaml > otel-collector-config.bak.yaml

Kemas kini dan gunakan konfigurasi baru

Tambah pemproses batch:

processors:
  batch:
    timeout: 5s
    send_batch_size: 1000

Gunakan:

kubectl apply -f otel-collector-config.yaml
kubectl rollout restart deployment otel-collector

Sahkan sasaran Prometheus

kubectl port-forward svc/otel-collector 8888
curl http://localhost:8888/metrics | grep otel

Kawalan Risiko

  • Uji perubahan konfigurasi di persekitaran pementasan dahulu.
  • Gunakan strategi biru/hijau untuk kemas kini collector.
  • Sandarkan ConfigMap dan Deployment semasa.
  • Pantau penggunaan sumber collector untuk elakkan OOM.

Balik Pulih

Jika masalah timbul, balik pulih segera:

kubectl apply -f otel-collector-config.bak.yaml
kubectl rollout restart deployment otel-collector

Pengesahan

  1. Periksa Grafana: Kependaman P99 harus menurun.2. Jejak OpenTelemetry kini menunjukkan rentang pangkalan data.3. Jalankan PromQL: histogram_quantile(0.99, rate(http_request_duration_seconds_bucket[5m])).

Bila Hantar Tiket OpsGlobal

  • Isu masih berterusan selepas semua langkah.2. Metrik atau jejak teras hilang sepenuhnya.3. Perlukan bantuan mengoptimumkan prestasi atau konfigurasi collector.4. Syak ada hambatan infrastruktur yang tidak diketahui.

Senario Penggunaan

Sesuai untuk pasukan yang menyelesaikan isu Observability dan memerlukan aliran kerja yang jelas.

Latar Belakang Masalah

Post ini membimbing senario sebenar mendiagnosis metrik dan jejak yang hilang dalam persekitaran Kubernetes menggunakan Prometheus, Grafana, dan OpenTelemetry, lengkap dengan langkah-langkah dan kawalan risiko.

Langkah Penyelesaian

Sahkan impak dan perubahan terkini, kumpul log, konfigurasi dan metrik, kemudian baiki mengikut risiko.

Contoh Arahan

Gantikan contoh dengan nama sumber sebenar dan simpan kata laluan, token atau kunci dalam pembolehubah persekitaran.

Risiko

Sebelum operasi produksi, semak sandaran, akses, tetingkap perubahan dan pelan rollback.

Pelan Rollback

Simpan konfigurasi dan versi asal; rollback konfigurasi, imej atau perubahan pangkalan data jika metrik tidak normal.

Senarai Serahan

Rekod punca isu, arahan penting, langkah pembaikan, hasil pengesahan dan cadangan susulan.

!

Perlu bantuan isu teknikal serupa?

Jika pelayan, Kubernetes, Docker, CI/CD, pangkalan data atau pemantauan anda bermasalah, hantar log dan konfigurasi untuk diagnosis jauh.

Tiket Hubungi WhatsApp Konsultasi