利用shell腳本來監控linux系統的負載與CPU佔用情況

最近在學習關於測試相關知識，看到一篇不錯的文章。轉載分享了~ 有興趣的同學可以看看~同時也歡迎交流討論

轉載文章信息如右：原始出處、作者信息和本聲明。否則將追究法律責任。http://huangrs.blog.51cto.com/2677571/788379

這幾天在學習研究shell腳本，寫的一些系統負載與CPU監控腳本程序。在沒有nagios監控軟件的情況下，只要服務器能上互聯網，就可通過發郵件的方式來提醒管理員系統負載與CPU佔用的使用情況。

一、安裝linux下面的一個郵件客戶端msmtp軟件(類似於一個foxmail的工具)

1、下載安裝： http://downloads.sourceforge.net/msmtp/msmtp-1.4.16.tar.bz2?modtime=1217206451&big_mirror=0
# tar jxvf msmtp-1.4.16.tar.bz2
# cd msmtp-1.4.16
# ./configure --prefix=/usr/local/msmtp
# make
# make install

2、創建msmtp配置文件和日誌文件（host爲郵件域名，郵件用戶名test，密碼123456）
# vim ~/.msmtprc

account default
host 126.com
from [email protected]
auth login
user test
password 123456
logfile ~/.msmtp.log

# chmod 600 ~/.msmtprc
# touch ~/.msmtp.log

3、mutt安裝配置：（一般linux下有默認安裝mutt）
# vim ~/.muttrc

set sendmail="/usr/local/msmtp/bin/msmtp"
set use_from=yes
set realname="moniter"
set from=test@126.com
set envelope_from=yes
set rfc2047_parameters=yes
set charset="utf-8"

4、郵件發送測試（-s郵件標題，-a表加附件）
# echo "郵件內容123456" | mutt -s "郵件標題測試郵件" -a /scripts/test.txt [email protected]

二、監控服務器系統負載情況：

1、用uptime命令查看當前負載情況（1分鐘，5分鐘，15分鐘平均負載情況）
# uptime
15:43:59 up 186 days, 20:04, 1 user, load average: 0.01, 0.02, 0.00

系統負荷的經驗法則：(摘自http://www.ruanyifeng.com/blog/2011/07/linux_load_average_explained.html)
(1) 主要觀察"15分鐘系統負荷"，將它作爲電腦正常運行的指標。
(2) 如果15分鐘內，（系統負荷除以CPU核心數目之後的）平均負荷大於1.0，表明問題持續存在，不是暫時現象。
(3) 當系統負荷持續大於0.7，你必須開始調查了，問題出在哪裏，防止情況惡化。
(4) 當系統負荷持續大於1.0，你必須動手尋找解決辦法，把這個值降下來。
(5) 當系統負荷達到5.0，就表明你的系統有很嚴重的問題，長時間沒有響應，或者接近死機了。

2、查看服務器cpu的總核數
# grep -c 'model name' /proc/cpuinfo

3、截取服務器1分鐘、5分鐘、15分鐘的負載情況
# uptime | awk '{print $8,$9,$10,$11,$12}'
load average: 0.01, 0.02, 0.00

4、查看截取15分鐘的平均負載
# uptime | awk '{print $12}' （用 '{print $12}' 這個獲取的不夠準確，如果都用awk取第12個字段的話，結果有可能爲空了。而用$NF表輸出最後一段的內容）
# uptime | awk '{print $NF}'

5、編寫系統負載監控的腳本文件：
# vim /scripts/load-check.sh

#!/bin/bash
#使用uptime命令監控linux系統負載變化
#取系統當前時間（以追加的方式寫入文件>>）
date >> /scripts/datetime-load.txt
#提取服務器1分鐘、5分鐘、15分鐘的負載情況
uptime | awk '{print $8,$9,$10,$11,$12}' >> /scripts/load.txt
#逐行連接上面的時間和負載相關行數據（每次重新寫入文件>）
paste /scripts/datetime-load.txt /scripts/load.txt > /scripts/load_day.txt

# chmod a+x /scripts/load-check.sh

6、編寫系統負載結果文件郵件發送腳本：
# vim /scripts/sendmail-load.sh

#!/bin/bash
#把系統負載監控生成的load_day.txt文件通過郵件發送給用戶
#提取本服務器的IP地址信息
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`
#提取當前日期
today=`date -d "0 day" +%Y年%m月%d日`
#發送系統負載監控結果郵件
echo "這是$IP服務器$today的系統負載監控報告，請下載附件。" | mutt -s "$IP服務器$today的系統負載監控報告" -a /scripts/load_day.txt [email protected]

# chmod a+x /scripts/sendmail-load.sh

7、編寫系統負載監控的腳本文件：
# vim /scripts/load-warning.sh

#!/bin/bash
#使用uptime命令監控linux系統負載變化
#提取本服務器的IP地址信息
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`
#抓取cpu的總核數
cpu_num=`grep -c 'model name' /proc/cpuinfo`
#抓取當前系統15分鐘的平均負載值
load_15=`uptime | awk '{print $NF}'`
#計算當前系統單個核心15分鐘的平均負載值，結果小於1.0時前面個位數補0。
average_load=`echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc`
#取上面平均負載值的個位整數
average_int=`echo $average_load | cut -f 1 -d "."`
#設置系統單個核心15分鐘的平均負載的告警值爲0.70(即使用超過70%的時候告警)。
load_warn=0.70
#當單個核心15分鐘的平均負載值大於等於1.0（即個位整數大於0），直接發郵件告警；如果小於1.0則進行二次比較
if (($average_int > 0)); then
echo "$IP服務器15分鐘的系統平均負載爲$average_load，超過警戒值1.0，請立即處理！！！" | mutt -s "$IP 服務器系統負載嚴重告警！！！" [email protected]
else
#當前系統15分鐘平均負載值與告警值進行比較（當大於告警值0.70時會返回1，小於時會返回0 ）
load_now=`expr $average_load \> $load_warn`
#如果系統單個核心15分鐘的平均負載值大於告警值0.70（返回值爲1），則發郵件給管理員
if (($load_now == 1)); then
echo "$IP服務器15分鐘的系統平均負載達到 $average_load，超過警戒值0.70，請及時處理。" | mutt -s "$IP 服務器系統負載告警" [email protected]
fi
fi

# chmod a+x /scripts/load-warning.sh

三、監控服務器系統cpu佔用情況：

1、使用top命令查看linux系統cpu使用情況：
# top -b -n 1 | grep Cpu   （-b -n 1 表只需要1次的輸出結果）
     Cpu(s): 0.0%us, 0.0%sy, 0.0%ni, 99.9%id, 0.0%wa, 0.0%hi, 0.0%si, 0.0%st
                                                           (空閒值)

2、查看截取空閒cpu的百分比數值命令（只取整數部分）：
# top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."

3、編寫cpu監控的腳本文件：
# vim /scripts/cpu-check.sh

#!/bin/bash
#使用top命令監控linux系統cpu變化
#取系統當前時間（以追加的方式寫入文件>>）
date >> /scripts/datetime-cpu.txt
#抓取當前cpu的值（以追加的方式寫入文件>>）
top -b -n 1 | grep Cpu >> /scripts/cpu-now.txt
#逐行連接上面的時間和cpu相關行數據（每次重新寫入文件>）
paste /scripts/datetime-cpu.txt /scripts/cpu-now.txt > /scripts/cpu.txt

# chmod a+x /scripts/cpu-check.sh

4、查看CPU監控的結果文件：
# cat /scripts/cpu.txt

5、編寫cpu結果文件郵件發送腳本：
# vim /scripts/sendmail-cpu.sh

#!/bin/bash
#把生成的cpu.txt文件通過郵件發送給用戶
#提取本服務器的IP地址信息
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`
#提取當前日期
today=`date -d "0 day" +%Y年%m月%d日`
#發送cpu監控結果郵件
echo "這是$IP服務器$today的cpu監控報告，請下載附件。" | mutt -s "$IP服務器$today的CPU監控報告" -a /scripts/cpu.txt [email protected]

# chmod a+x /scripts/sendmail-cpu.sh

四、監控系統cpu的情況，當使用超過80%的時候發告警郵件：

# vim /scripts/cpu-warning.sh

#!/bin/bash
#監控系統cpu的情況腳本程序
#提取本服務器的IP地址信息
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`
#取當前空閒cpu百份比值（只取整數部分）
cpu_idle=`top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."`
#設置空閒cpu的告警值爲20%，如果當前cpu使用超過80%（即剩餘小於20%），立即發郵件告警
if (($cpu_idle < 20)); then
echo "$IP服務器cpu剩餘$cpu_idle%，使用率已經超過80%，請及時處理。" | mutt -s "$IP 服務器CPU告警" [email protected]
fi

# chmod a+x /scripts/cpu-warning.sh

五、加入任務計劃：系統負載與CPU佔用率每十分鐘檢測一次，有告警則立即發郵件(十分鐘發一次)，負載與CPU檢測結果郵件每天早上8點發一次

# crontab -e

*/10 * * * * /scripts/load-check.sh
*/10 * * * * /scripts/load-warning.sh
0 8 * * * /scripts/sendmail-load.sh
*/10 * * * * /scripts/cpu-check.sh
*/10 * * * * /scripts/cpu-warning.sh
0 8 * * * /scripts/sendmail-cpu.sh

# service crond restart

利用shell腳本來監控linux系統的負載與CPU佔用情況

985 碩士程序員，空窗 4 個月沒有 Offer！

賽博鬥地主——使用大語言模型扮演Agent智能體玩牌類遊戲。

VScode右鍵打開(添加到右鍵)

C# 保存Excel文件（打開Excel文件格式與擴展名指定格式不一致）

靜態語言、動態語言、強類型語言、弱類型語言

VS2013使用OpenGL

winform中contextMenuStrip使用

C#winform saveFileDialog控件使用

Mac下配置sublime實現LaTeX

https://yachay.unat.edu.pe/blog/index.php?comment_area=format_blog&comment_component=blog&comment_co

linux以太網驅動總結