Tempah Konsultasi Hantar Tiket

Pemerhatian Bersepadu dengan Prometheus, Grafana, dan OpenTelemetry: Panduan Praktikal untuk SRE

Panduan ini menerangkan integrasi Prometheus, Grafana, dan OpenTelemetry untuk timbunan pemerhatian bersepadu di Kubernetes, merangkumi senario, gejala, diagnosis, arahan penggunaan, kawalan risiko, pengembalian, pengesahan, dan bila untuk menghubungi OpsGlobal.

Pemerhatian Bersepadu dengan Prometheus, Grafana, dan OpenTelemetry: Panduan Praktikal untuk SRE
Observability 6min 36 paparan 2026-07-16
KubernetesSREpemerhatian

Senario

Aplikasi mikroservis berjalan di kluster Kubernetes. Pasukan menggunakan Prometheus (metrik), Elasticsearch (log), dan Jaeger (jejak) secara berasingan, tetapi tiada perkaitan antara metrik, log, dan jejak, menyebabkan Masa Purata untuk Resolusi (MTTR) yang tinggi.

Gejala

  • Amaran kerap tetapi punca akar tidak jelas.
  • Metrik menunjukkan kependaman tinggi tetapi tidak dapat dikaitkan dengan perkhidmatan atau permintaan tertentu.
  • Data jejak tidak lengkap, kekurangan konteks merentas perkhidmatan.

Diagnosis

Isu utama ialah ketiadaan saluran paip pemerhatian bersepadu. OpenTelemetry, piawaian CNCF, boleh mengumpul metrik, log, dan jejak secara seragam dan mengeksportnya ke Prometheus (metrik) dan Grafana Tempo (jejak). Grafana berfungsi sebagai papan pemuka tunggal.

Arahan

1. Gunakan Pengumpul OpenTelemetry

Gunakan Helm untuk memasang Pengumpul OpenTelemetry sebagai DaemonSet untuk mengumpul data dari setiap nod.

helm repo add open-telemetry https://open-telemetry.github.io/opentelemetry-helm-charts
helm install otel-collector open-telemetry/opentelemetry-collector \
  --set mode=daemonset \
  --set config.receivers.otlp.protocols.grpc.endpoint=0.0.0.0:4317 \
  --set config.exporters.prometheus.endpoint=0.0.0.0:8889 \
  --set config.exporters.otlp.endpoint=tempo.default.svc.cluster.local:4317

2. Konfigurasikan Sasaran Scrape Prometheus

Tambah titik akhir metrik Pengumpul OpenTelemetry ke konfigurasi Prometheus.

scrape_configs:
  - job_name: 'otel-collector'
    scrape_interval: 10s
    static_configs:
      - targets: ['otel-collector.default.svc.cluster.local:8889']

3. Gunakan Grafana Tempo untuk Jejak

helm install tempo grafana/tempo --set storage.trace.backend=local

4. Konfigurasikan Sumber Data Grafana

Tambah sumber data Prometheus dan Tempo di Grafana, dan tetapkan OpenTelemetry sebagai sumber data jejak.

Kawalan Risiko

  • Hadkan sumber pengumpul (CPU/memori) untuk mengelakkan kesan pada kontena perniagaan.
  • Gunakan penyulitan TLS untuk penghantaran bagi mengelakkan kebocoran data.
  • Tetapkan kadar pensampelan (cth. 10%) untuk mengelakkan ledakan data jejak.

Pengembalian

Jika masalah timbul, padamkan keluaran Helm dan pulihkan konfigurasi asal:

helm uninstall otel-collector
helm uninstall tempo
# Pulihkan konfigurasi Prometheus

Padamkan sumber data Grafana yang baru ditambah.

Pengesahan

  • Periksa sasaran Prometheus di http://prometheus:9090/targets; status sepatutnya UP.
  • Di Grafana, tambah papan pemuka "Tempo", jalankan pertanyaan, dan lihat butiran jejak.
  • Gunakan kubectl logs untuk mengesahkan log pengumpul tiada ralat.

Bila untuk Menghantar Tiket OpsGlobal

  • Perlu mengendalikan metrik kardinaliti tinggi atau strategi pensampelan tersuai.
  • Kluster melebihi 100 nod, menyebabkan bottleneck prestasi pengumpul.
  • Perlu pemproses atau pengeksport OpenTelemetry tersuai.
  • Keperluan lanjutan untuk mengintegrasikan amaran dan papan pemuka. OpsGlobal menyediakan sokongan pakar 24/7 untuk mempercepatkan perjalanan pemerhatian anda.

Senario Penggunaan

Sesuai untuk pasukan yang menyelesaikan isu Observability dan memerlukan aliran kerja yang jelas.

Latar Belakang Masalah

Panduan ini menerangkan integrasi Prometheus, Grafana, dan OpenTelemetry untuk timbunan pemerhatian bersepadu di Kubernetes, merangkumi senario, gejala, diagnosis, arahan penggunaan, kawalan risiko, pengembalian, pengesahan, dan bila untuk menghubungi OpsGlobal.

Langkah Penyelesaian

Sahkan impak dan perubahan terkini, kumpul log, konfigurasi dan metrik, kemudian baiki mengikut risiko.

Contoh Arahan

Gantikan contoh dengan nama sumber sebenar dan simpan kata laluan, token atau kunci dalam pembolehubah persekitaran.

Risiko

Sebelum operasi produksi, semak sandaran, akses, tetingkap perubahan dan pelan rollback.

Pelan Rollback

Simpan konfigurasi dan versi asal; rollback konfigurasi, imej atau perubahan pangkalan data jika metrik tidak normal.

Senarai Serahan

Rekod punca isu, arahan penting, langkah pembaikan, hasil pengesahan dan cadangan susulan.

!

Perlu bantuan isu teknikal serupa?

Jika pelayan, Kubernetes, Docker, CI/CD, pangkalan data atau pemantauan anda bermasalah, hantar log dan konfigurasi untuk diagnosis jauh.

Tiket Hubungi WhatsApp Konsultasi