监控系统负载与CPU、内存、硬盘、登录用户数,超出警戒值则发邮件告警。

时间:2022-02-16 19:24:41

zzx@zzx:~$ cat warning.sh 
#!/bin/bash

#监控系统负载与CPU、内存、硬盘、登录用户数,超出警戒值则发邮件告警。    前提安装mail服务
nh=`uname -r`     #查当前使用内核  3.2.0-29-generic

echo 系统当前使用内核为:$nh
 Mail=XXX@126.com
 #提取本服务器的IP地址信息
 IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`
 
  # 1、监控系统负载的变化情况,超出时发邮件告警:
  
   #抓取cpu的总核数
   cpu_num=`grep -c 'model name' /proc/cpuinfo`
    #抓取当前系统15分钟的平均负载值
    load_15=`uptime | awk -F"," '{print $5}'| cut -f1 -d","`
    
     #计算当前系统单个核心15分钟的平均负载值,结果小于1.0时前面个位数补0。
     average_load=`echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc`
     
      #取上面平均负载值的个位整数
      average_int=`echo $average_load | cut -f 1 -d "."`
      
       #设置系统单个核心15分钟的平均负载的告警值为0.70(即使用超过70%的时候告警)。
       load_warn=0.70
        #当单个核心15分钟的平均负载值大于等于1.0(即个位整数大于0) ,直接发邮件告警;如果小于1.0则进行二次比较
        if  [ $average_int -gt 0 ];then
        echo "$IP服务器15分钟的系统平均负载为$average_load,超过警戒值1.0,请立即处理!!!" | mail -s "$IP 服务器系统负载严重告警!!" $MAil
           else        
         #当前系统15分钟平均负载值与告警值进行比较(当大于告警值0.70时会返回1,小于时会返回0 )
        # load_now=`expr $average_load \> $load_warn`
          load_now=`echo "$average_load>$load_warn"|bc`
          #如果系统单个核心15分钟的平均负载值大于告警值0.70(返回值为1),则发邮件给管理员
          if [ $load_now -eq 0 ];then
          echo "$IP 服务器15分钟的系统平均负载达到 $average_load,超过警戒值0.70,请及时处理。"| mail -s "$IP 服务器系统负载告警" $Mail
        # $Mail
          fi
          
           fi
           echo 1end
            # 2、监控系统cpu的情况,当使用超过80%的时候发告警邮件:
            
             #取当前空闲cpu百份比值(只取整数部分)
             cpu_idle=`top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."`
             echo 空闲cpu:$cpu_idle%
              #设置空闲cpu的告警值为20%,如果当前cpu使用超过80%(即剩余小于20%),立即发邮件告警
              if [ $cpu_idle -ge 20 ]; then
             echo "$IP服务器cpu剩余$cpu_idle%,使用率已经超过80%,请及时处理。" | mail -s "$IP 服务器CPU告警" $Mail
              fi
              echo 2end
               # 3、监控系统交换分区swap的情况,当使用超过80%的时候发告警邮件:
               
                #系统分配的交换分区总量
                swap_total=`free -m | grep Swap | awk '{print $2}'`
                
                 #当前剩余的交换分区free大小
                 swap_free=`free -m | grep Swap | awk '{print $4}'`
                 
                  #当前已使用的交换分区used大小
                  swap_used=`free -m | grep Swap | awk '{print $3}'`
#echo $swap_free                  
                   if [ $swap_used -eq 0 ]; then  # -ne 0
                   #如果交换分区已被使用,则计算当前剩余交换分区free所占总量的百分比,用小数来表示,要在小数点前面补一个整数位0
                   swap_per=0`echo "scale=2;$swap_free/$swap_total" | bc`
                 #  echo swap_per$swap_per                   
                    #设置交换分区的告警值为20%(即使用超过80%的时候告警)。
                    swap_warn=0.20
                    
                     #当前剩余交换分区百分比与告警值进行比较(当大于告警值(即剩余20%以上)时会返回1,小于(即剩余不足20%)时会返回0 )
                     swap_now=`echo "$swap_per>$swap_warn"|bc`
#                    echo "swap_now:${swap_now}"
                     
                      #如果当前交换分区使用超过80%(即剩余小于20%,上面的返回值等于0),立即发邮件告警
                    if [ $swap_now -ne 0 ];then #  if (($swap_now != 0)); then
                      echo swapfree:${swap_free}M
                      echo "$IP服务器swap交换分区只剩下 $swap_free M 未使用,剩余不足20%,使用率已经超过80%,请及时处理。" | mail -s "$IP 服务器内存告警" $Mail
                      fi
                      
                       fi
                       echo 3end
                        # 4、监控系统硬盘根分区使用的情况,当使用超过80%的时候发告警邮件:
                        
                         #取当前根分区(/dev/sda1)已用的百份比值(只取整数部分)
                         disk_sda1=`df -h | grep /dev/sda1 | awk '{print $5}' | cut -f 1 -d "%"`
                         
                          #设置空闲硬盘容量的告警值为80%,如果当前硬盘使用超过80%,立即发邮件告警
                          if (($disk_sda1 > 1)); then   #设置 >80
echo "$IP 跟分区使用率已经超过1 达到  ${disk_sda1}%"
                          echo "$IP 服务器 /根分区 使用率已经超过1%,达到 $disk_sda1请及时处理。" | mail -s "$IP 服务器硬盘告警" $Mail
                          fi
                           echo 4end
                           #5、监控系统用户登录的情况,当用户数超过3个的时候发告警邮件:
                           
                            #取当前用户登录数(只取数值部分)
                            users=`uptime | awk -F"," '{print $3}'|awk '{print $1}'`
                            
                             #设置登录用户数的告警值为3个,如果当前用户数超过3个,立即发邮件告警
                     if [ $users  -ge 1 ]; then  # -ge 3
echo "$IP 用户数达到$users 请处理"
                             echo "$IP 服务器用户数已经达到$users个,请及时处理。" | mail -s "$IP 服务器用户数告警" $Mail
                             fi
                          echo 5end

~~~~~~~~~~~~~~~~~~~~~~~~~~

二、加入任务计划:每十分钟检测一次,有告警则立即发邮件(十分钟发一次)。

复制代码代码示例:
# crontab -e
*/10 * * * *  /scripts/sys-warning.sh 
# service crond restart