此处默认已安装Prometheus服务,服务地址:192.168.56.200

前言

Alertmanager 是prometheus监控的一个独立部署的组件。prometheus收集指标后,通过规则配置,如果发现需要告警,就会发送告警信息到Alertmanager进行告警。Alertmanager通过配置的是邮件告警还是企业微信告警,再具体发送到用户通知上。

一、安装Alertmanager

此处采用源码编译的方式安装。首先下载alertmanager的软件包,下载地址:https://github.com/prometheus/alertmanager/releases/download/v0.19.0/alertmanager-0.19.0.linux-amd64.tar.gz

下载完成后,将下载中软件包上传至Prometheus服务所在的机器(192.168.56.200)的 /usr/local 目录下

2.Prometheus Alertmanager 配置邮件报警 - 图1

解压alertmanager软件包:

  1. # tar -zvxf alertmanager-0.19.0.linux-amd64.tar.gz
  2. # mv alertmanager-0.19.0.linux-amd64/ alertmanager

进入解压后的alertmanager文件夹,修改alertmanager.yml文件,配置报警信息,alertmanager.yml 内容如下:

  1. global:
  2. resolve_timeout: 5m
  3. smtp_smarthost: 'smtp.126.com:465'
  4. smtp_from: '****@126.com' # 用于发送告警右键的邮箱
  5. smtp_auth_username: '****@126.com'
  6. smtp_auth_password: '****' #此处为邮箱的授权密码,非邮箱登录密码
  7. smtp_require_tls: false
  8. route: # 设置报警分发策略
  9. group_by: ['alertname'] # 分组标签
  10. group_wait: 10s # 告警等待时间。告警产生后等待10s,如果有同组告警一起发出
  11. group_interval: 10s # 两组告警的间隔时间
  12. repeat_interval: 1m # 重复告警的间隔时间,减少相同右键的发送频率 此处为测试设置为1分钟
  13. receiver: 'mail' # 默认接收者 routes: # 指定那些组可以接收消息
  14. - receiver: mail
  15. receivers:
  16. - name: 'mail'
  17. email_configs:
  18. - to: '****@126.com' # 接收报警邮件的邮箱
  19. #inhibit_rules:
  20. # - source_match:
  21. # severity: 'critical'
  22. # target_match:
  23. # severity: 'warning'
  24. # equal: ['alertname', 'dev', 'instance']

检查alertmanager.yml 配置是否正确

  1. # ./amtool check-config alertmanager.yml

2.Prometheus Alertmanager 配置邮件报警 - 图2

配置正确

启动alertmanager

  1. # ./alertmanager

2.Prometheus Alertmanager 配置邮件报警 - 图3

可以看到alertmanager服务已经起来,服务所在的端口为9093

浏览器访问: http://192.168.56.200:9093 (IP:9093)

2.Prometheus Alertmanager 配置邮件报警 - 图4

alertmanager成功启动。

二、配置Prometheus

Ctrl+C 结束掉alertmanager服务进程,进入Prometheus的安装目录下修改Prometheus配置。

  1. # cd /usr/local/prometheus
  2. # vim prometheus.yml

修改Prometheus.yml文件中的 alerting 配置项及rule_files配置项

  1. alerting:
  2. alertmanagers:
  3. - static_configs:
  4. - targets: ['localhost:9093']

rule_files: #配置告警规则

  • “rule.yml”

修改完成后保存退出

以下是Prometheus.yml 文件全部内容:

  1. # my global config
  2. global:
  3. scrape_interval: 15s # Set the scrape interval to every 15 seconds. Default is every 1 minute.
  4. evaluation_interval: 15s # Evaluate rules every 15 seconds. The default is every 1 minute.
  5. # scrape_timeout is set to the global default (10s).
  6. # Alertmanager configuration
  7. alerting:
  8. alertmanagers:
  9. - static_configs:
  10. - targets: ['localhost:9093']
  11. # - alertmanager:9093
  12. # Load rules once and periodically evaluate them according to the global 'evaluation_interval'.
  13. rule_files:
  14. - "rule.yml"
  15. # - "first_rules.yml"
  16. # - "second_rules.yml"
  17. # A scrape configuration containing exactly one endpoint to scrape:
  18. # Here it's Prometheus itself.
  19. scrape_configs:
  20. # The job name is added as a label `job=<job_name>` to any timeseries scraped from this config.
  21. - job_name: 'prometheus'
  22. # metrics_path defaults to '/metrics'
  23. # scheme defaults to 'http'.
  24. static_configs:
  25. - targets: ['localhost:9090']
  26. - job_name: 'Linux'
  27. static_configs:
  28. - targets: ['192.168.56.201:9100']

编写告警规则文件rule.yml

  1. # vim rule.yml

将以下内容写入文件当中,(此处用于测试,设置为当内存占用高于10%时,就会告警)

  1. groups:
  2. - name: mem-rule
  3. rules:
  4. - alert: "内存报警"
  5. expr: (node_memory_MemTotal_bytes - (node_memory_MemFree_bytes+node_memory_Buffers_bytes+node_memory_Cached_bytes )) / node_memory_MemTotal_bytes * 100 > 10
  6. for: 30s
  7. labels:
  8. severity: warning
  9. annotations:
  10. summary: "服务名:{{$labels.alertname}} 内存报警"
  11. description: "{{ $labels.alertname }} 内存资源利用率大于 10%"
  12. value: "{{ $value }}"

保存退出

三、告警检测

重启Prometheus服务,使配置的告警规则生效

  1. # systemctl restart prometheus

进入alertmanager的安装文件夹,启动alertmanager

  1. # cd /usr/local/alertmanager
  2. # ./alertmanager

稍等片刻,登录设置的接收告警右键的邮箱,可以看到已经接收到告警邮件

2.Prometheus Alertmanager 配置邮件报警 - 图5

浏览器访问 http://192.168.56.200:9093/#/alerts ,也能看到告警信息

2.Prometheus Alertmanager 配置邮件报警 - 图6

四、配置alertmanager服务开机自启

Ctrl+C 结束掉 alertmanager 服务进程,创建 alertmanager服务,让 alertmanager 以服务的方式,开机自启。

添加系统服务

  1. # vim /etc/systemd/system/alertmanager.service

将以下内容写入文件中

  1. [Unit]
  2. Description=alertmanager
  3. After=network.target
  4. [Service]
  5. WorkingDirectory=/usr/local/alertmanager
  6. ExecStart=/usr/local/alertmanager/alertmanager --config.file=alertmanager.yml --log.level=debug --log.format=json
  7. Restart=on-failure
  8. [Install]
  9. WantedBy=multi-user.target

保存退出

启动服务,设置开机自启

#  systemctl daemon-reload
#  systemctl enable alertmanager
#  systemctl start alertmanager

至此Prometheus+alertmanage配置邮件报警完成。