代理节点“能ping通”不代表业务可用。DNS可能失败、认证可能返回407、TLS可能握手错误、HTTP可能超时,出口IP也可能与登记不一致。一个有效监控体系要从用户实际路径出发,把网络阶段、业务成功率和节点生命周期放在同一张看板上。
监控对象应是自有节点、自有健康端点或已经获得测试许可的服务,不能通过高频请求给第三方造成负载。
一、先定义什么叫可用
可用性定义应包含明确条件,例如:
- 代理主机能够解析;
- 在规定超时内完成TCP连接;
- 认证成功;
- 通过代理访问自有HTTPS健康端点成功;
- 证书校验通过;
- 出口IP与节点登记相符;
- 总耗时低于业务允许阈值。
只要定义不清,团队就会为“节点能连但业务不能用”反复争论。
二、监控指标按层拆分
| 层级 | 指标 | 典型异常 |
|---|---|---|
| DNS | 解析成功率、耗时、A/AAAA结果 | 过期地址、解析失败 |
| TCP | 连接成功率和耗时 | 端口不可达、链路超时 |
| 认证 | 407数量、白名单失败 | 凭据过期、出口变化 |
| TLS | 握手成功率、证书剩余期 | SNI、证书链、时间错误 |
| HTTP | 状态码、首字节、总耗时 | 502、503、504、目标故障 |
| 出口 | IP、ASN、地区与变化 | 节点重建、路由变化 |
| 容量 | 连接、带宽、流量和错误率 | 超限、拥塞、资源不足 |
三、SLO应该怎么写
SLO是服务级目标,应围绕业务体验,并写明测量窗口、样本和排除条件。例如“在一个滚动周期内,自有健康请求成功率达到约定目标,且延迟分位数低于阈值”。实际数字应依据业务重要性和基线数据确定,不能从其他公司的模板照抄。
对非关键测试节点,可以接受较低目标和人工恢复;对企业API固定出口,则应把切换、白名单和恢复时间纳入。
四、什么是错误预算
错误预算是SLO允许的不可用量。它帮助团队决定是否继续发布、优化还是暂停变更。若某周期已经消耗大量预算,就应减少高风险操作并优先处理稳定性。
错误预算不是允许忽视故障,而是把“绝对零故障”的口号变成可量化的工程决策。
五、为什么单一阈值容易误报
一次超时、一次DNS抖动或单个探针故障,都可能触发简单阈值。更可靠的告警会结合:
- 连续失败次数;
- 短窗口与长窗口错误率;
- 多个独立探针的共同结果;
- 业务流量与合成监控对照;
- 维护窗口和已知变更;
- 节点到期、凭据轮换等生命周期事件。
告警应提示“需要行动”,而不是把所有波动都发到群里。
六、探针应该部署在哪里
至少考虑实际客户端所在网络和一个独立对照位置。若只从云服务器测试,可能看不到办公室DNS、运营商路由和本地防火墙问题;只从办公室测试,又无法区分本地故障与节点故障。
多地区业务可部署少量代表性探针,但必须控制频率和数据量,并使用自有健康端点。
七、健康端点应该返回什么
理想的健康端点:
- 由企业自己控制;
- 不需要真实用户数据;
- 响应小、逻辑简单且稳定;
- 能返回请求ID、服务时间和必要的出口信息;
- 支持合理频率限制;
- 故障时可从服务端日志追踪。
不要把复杂业务首页或公共IP查询网站当作秒级心跳。
八、看板建议放哪些图表
| 看板区域 | 内容 |
|---|---|
| 总体 | SLO、错误预算、活跃节点与当前事故 |
| 成功率 | 按节点、地区、协议和阶段拆分 |
| 延迟 | 中位数、95/99分位和趋势 |
| 错误 | 407、502、503、504、TLS和DNS分类 |
| 出口 | 登记IP与当前检测结果、变化时间 |
| 容量 | 连接、带宽、流量和配额 |
| 生命周期 | 到期、续费、凭据轮换和变更窗口 |
九、告警收到后按什么流程处理
- 确认告警来自单探针还是多来源;
- 查看最近配置、凭据、DNS和订单变更;
- 按DNS、TCP、认证、TLS和HTTP确定故障阶段;
- 评估影响业务与是否需要切换备用节点;
- 执行经过验证的回退或故障转移;
- 记录时间线、恢复点和根因;
- 事故后修正阈值、文档和演练。
错误码分层可参考代理HTTP错误码排查;节点掉线与退避见NAT、连接池和自动恢复。
十、日志和标签怎样避免泄露
指标标签只使用节点ID、地区、协议、业务和配置版本,不把完整IP凭据、用户名、密码、URL参数、Cookie或个人数据作为标签。高基数标签还会增加监控成本,应避免把请求ID直接放进指标。
详细请求ID可以进入受控日志,并设置访问权限和保留期限。
十一、备用节点也必须纳入监控
只监控主节点、故障时才发现备用已过期,是常见失误。备用节点应定期做低频健康检查,确认认证、白名单、出口和容量;但不要承接未授权的生产流量。
十二、监控上线前做一次故障演练
在测试环境模拟DNS失败、407、TLS错误、慢响应、单节点下线、凭据轮换和到期状态,检查告警是否准确、负责人是否收到、看板是否能定位、切换是否可回退。
监控的最终价值不是显示一排绿色,而是在真实故障发生时,团队知道哪里坏了、影响什么、谁来处理以及如何安全恢复。






