核心指标包括:CPU、内存、磁盘IO、磁盘空间、网络带宽与丢包率,以及服务层面的进程健康和响应时间。针对台湾VPS与中华电信高防御云空间,还应增加防火墙连接数、TCP半开连接数与异常流量速率等与网络安全相关的指标。
一般基础资源1分钟采集一次,关键业务与安全事件应做到10–30秒级采集;日志类(如WAF/防火墙)可通过采样与聚合降低成本。
采用多级告警策略:信息级(Info)、警告级(Warning)、严重级(Critical)。信息级用于容量预测与日常趋势;警告级提示需关注;严重级触发人工介入与自动化脚本。配合抑制策略(抖动阈值、持续时间)减少误报。
阈值结合业务SLA设定,比如CPU 85%持续5分钟触发警告,95%持续1分钟触发严重告警。对网络波动可采用移动平均或短期抑制窗口。
使用多通道(短信、邮件、IM、PagerDuty)并设定等级对应的接收人/群组与自动升级策略,确保关键告警有人响应。
重点监控流量峰值、每秒连接数(CPS)、每秒请求数(RPS)、源IP分布与地理分布。结合WAF/防火墙日志识别异常请求模式与速率突增。对接中华电信提供的防护控制台API,实现告警联动。
持续统计访问行为特征(UA、URI、Referer),发现异常行为后自动加入临时黑名单并触发人工审核。
发生大流量攻击时,通过已配置的SLA通道请求中华电信上游清洗,并记录清洗前后流量曲线作为事后分析依据。
先行基于IP/端口/协议粗筛,再基于HTTP特征做精筛,必要时打开速率限制与挑战响应(如验证码)。
故障响应流程要标准化:检测→定位→通知→缓解→恢复→复盘。报警系统应能自动创建工单并填充诊断信息(最近采样、日志片段、网络抓包链接)。同时触发自动化脚本(例如扩容、重启服务、切换流量)以缩短恢复时间。
为高风险操作设置人工二次确认,常见低风险操作如清理缓存、重启非核心进程可自动执行并回填结果。
定期生成容量与异常事件报表,分析告警噪声率、平均处理时间、误报比例与重复告警来源。基于历史数据调整阈值、采集频率与监控点,识别长期趋势并做容量规划。
设定KPI:MTTR、MTTA、告警重复率等,按月评估并在运行手册中更新相应策略;同时将经验固化为自动化Playbook。