當伺服器變慢、網站掛掉,該檢查什麼?今天要學 Linux 的四個「指令」,它們是所有 SRE (Site Reliability Engineering) 的日常必備工具。
必備監控工具清單
| 指令 | 用途 | 關鍵用途 |
|---|---|---|
| htop | 互動式監控 | 查看 CPU、記憶體、各行程 (Process) 的即時狀態 |
| df -h | 硬碟空間檢查 | 檢查各分區磁碟剩餘空間 (Disk Free) |
| free -h | 記憶體檢查 | 檢查記憶體使用量與快取 (Free Memory) |
| systemctl | 服務管理 | 查看 Nginx 等背景程式是否活著 (System Control) |
實作
安裝與開啟互動式資源監控儀表板
執行指令:sudo apt update && sudo apt install htop -y 接著輸入 htop
操作目的:查看即時的 CPU 使用率、記憶體(Mem)佔用量以及正在運作的背景程序(Process)。
結束:按下鍵盤上的 F10 鍵(或按 Ctrl + C)即可離開畫面。

檢查硬碟剩餘空間 (df -h)
執行指令:df -h
操作目的:確認硬碟磁碟區是否快被塞滿。
重點欄位:觀察 /dev/sda1(挂載點為 / 的主磁碟)的 Use%。若接近或超過 90%,就需要清理日誌或備份檔以防系統崩潰。
檢查記憶體使用量 (free -h)
執行指令:free -h
操作目的:評估系統記憶體是否足夠。
重點欄位:查看 available 欄位,這代表伺服器目前真正還能調用的剩餘記憶體空間。
檢查與管理背景服務狀態 (systemctl)
執行指令:sudo systemctl status nginx
操作目的:檢查特定的關鍵服務(如 Nginx 網頁伺服器)是否活著。
重點欄位:確認是否有顯示綠色的 active (running)。若服務掛掉,可透過 sudo systemctl restart nginx 重新啟動。