主动监控

配置 HTTP/HTTPS 探针,主动检测服务可用性,及时发现故障

概述

主动监控是 1Duty 提供的服务可用性检测功能。与被动接收外部告警不同,主动监控通过定期向目标端点发送 HTTP/HTTPS 请求来探测服务状态,在服务异常时自动触发告警并创建事件。

主动监控适用于以下场景:

创建探针

按照以下步骤创建一个新的主动监控探针:

  1. 进入「告警管理」菜单,点击「主动监控」
  2. 点击页面右上角的「新建探针」按钮
  3. 填写探针的基本信息和检测参数
  4. 配置告警规则和关联团队
  5. 点击「保存」完成创建

探针配置

创建探针时需要配置以下参数:

基本参数

参数说明示例
名称探针的显示名称,便于识别官网首页检测
目标 URL要检测的 HTTP/HTTPS 端点地址https://www.example.com/health
请求方法HTTP 请求方法GET / POST / HEAD
检测间隔两次检测之间的时间间隔30秒 / 1分钟 / 5分钟
超时时间单次请求的最大等待时间5秒 / 10秒 / 30秒

高级参数

参数说明
期望状态码期望返回的 HTTP 状态码,默认为 200。支持配置范围(如 2xx 表示 200-299)
请求头自定义 HTTP 请求头,如 Authorization、Content-Type 等
请求体POST/PUT 请求的请求体内容
响应关键字期望响应体中包含的关键字,用于验证返回内容的正确性
关联团队探针触发告警时通知的值班团队

建议为核心业务服务配置较短的检测间隔(如 30 秒),非关键服务可使用较长间隔(如 5 分钟)以节省资源。

探针状态

探针根据检测结果会处于以下三种状态之一:

状态图标说明
健康 (Healthy)绿色连续检测均成功,服务正常运行
降级 (Degraded)黄色部分检测失败或响应时间异常偏高,服务不稳定
故障 (Down)红色连续多次检测失败,服务不可用

状态判定规则

探针状态的变化遵循以下规则:

为避免网络抖动导致的误报,建议设置连续失败次数阈值为 2-3 次后再触发告警。

告警触发

当探针状态变为故障 (Down) 时,系统将自动触发告警。告警流程如下:

  1. 探针检测到连续失败,状态变为故障
  2. 系统生成一条告警事件,包含探针名称、目标 URL、失败原因等信息
  3. 告警事件进入分派流程,根据探针关联的团队进行通知
  4. 值班人员收到通知后进行处理
  5. 当服务恢复时,探针状态恢复为健康,系统自动发送恢复通知

告警事件内容

探针触发的告警事件包含以下信息:

与事件管理集成

主动监控生成的告警事件与外部接入的告警事件享有完全相同的处理流程:

建议将主动监控与告警接入配合使用:主动监控负责检测"是否可访问",告警接入负责收集"内部异常指标",两者互补形成完整的监控体系。