Senario
Pelayan web pengeluaran mengalami kelambatan keseluruhan, dengan pengguna melaporkan tamat masa halaman. Pemantauan menunjukkan purata beban sistem secara konsisten melebihi 80% daripada teras CPU.
Gejala
- Kependaman permintaan aplikasi meningkat dengan ketara
- Log masuk SSH terasa lambat
topatauuptimemenunjukkan purata beban tinggi- Mungkin disertai dengan penggunaan CPU tinggi, I/O wait tinggi, atau pertukaran memori
Langkah Diagnostik
- Pemeriksaan sistem pantas:
bash uptime top -bn1 | head -n 20 free -h df -h - Analisis penggunaan CPU:
bash mpstat -P ALL 1 5 # Fokus pada %usr, %sys, %iowait - Kenal pasti proses CPU tinggi:
bash ps aux --sort=-%cpu | head -10 pidstat -u 1 5 - Periksa I/O cakera (jika %iowait tinggi):
bash iostat -x 1 5 # Lihat await, %util - Jejak panggilan sistem (berhati-hati):
bash strace -p <PID> -c -S time 2>&1 | head -20 # jalankan hanya 5 saat - Log kernel:
bash dmesg --level=err,warn | tail -20
Kawalan Risiko
- Sebelum menjalankan diagnostik pada pengeluaran, utamakan replika atau nod trafik rendah
- Hadkan tempoh
strace(gunakan -S atau timeout) untuk mengelakkan proses tergantung - Elakkan
kill -9dalam pengeluaran; gunakankill -TERMatau mulakan semula perkhidmatan - Log semua arahan yang dilaksanakan dan outputnya
Langkah Rollback
Jika kesilapan berlaku atau pemulihan diperlukan:
- Jika proses kritikal dibunuh, mulakan semula perkhidmatan dengan segera: systemctl restart <nama-perkhidmatan>
- Jika parameter sistem (contohnya vm.swappiness) diubah, kembalikan dan muat semula: sysctl -p
- Jika alat sementara dipasang, buang dan bersihkan: yum remove -y <alat> atau apt-get purge
Pengesahan
- Sahkan beban menurun:
uptimedantopmenunjukkan purata beban normal - Sahkan respons aplikasi: uji titik akhir API dengan curl untuk masa
- Periksa bahawa amaran pemantauan hilang
Bila untuk Menghantar Tiket OpsGlobal
- Punca asas tidak jelas (contohnya disyaki kegagalan perkakasan)
- Lonjakan beban berterusan tanpa kawalan
- Nyahpepijat mendalam (contohnya analisis perf) atau penalaan kernel diperlukan
- Perlu pengembangan kapasiti atau perubahan seni bina
Senario Penggunaan
Sesuai untuk pasukan yang menyelesaikan isu DevOps dan memerlukan aliran kerja yang jelas.
Latar Belakang Masalah
Buku panduan ini menyediakan pendekatan sistematik untuk mendiagnosis beban sistem tinggi pada pelayan pengeluaran Linux, meliputi gejala, arahan diagnostik, kawalan risiko, rollback, pengesahan, dan bila untuk menghantar tiket OpsGlobal.
Langkah Penyelesaian
Sahkan impak dan perubahan terkini, kumpul log, konfigurasi dan metrik, kemudian baiki mengikut risiko.
Contoh Arahan
Gantikan contoh dengan nama sumber sebenar dan simpan kata laluan, token atau kunci dalam pembolehubah persekitaran.
Risiko
Sebelum operasi produksi, semak sandaran, akses, tetingkap perubahan dan pelan rollback.
Pelan Rollback
Simpan konfigurasi dan versi asal; rollback konfigurasi, imej atau perubahan pangkalan data jika metrik tidak normal.
Senarai Serahan
Rekod punca isu, arahan penting, langkah pembaikan, hasil pengesahan dan cadangan susulan.
Perlu bantuan isu teknikal serupa?
Jika pelayan, Kubernetes, Docker, CI/CD, pangkalan data atau pemantauan anda bermasalah, hantar log dan konfigurasi untuk diagnosis jauh.