使用 SQL 进行客户影响分析
内部错误率并不能确定对客户的影响。事件响应需要记录产品结果:结帐失败、导出延迟、数据不可用或客户可能遇到的其他受控影响。
定义一个影响行
每个事件和批准的报告单元发出或派生一个有界行。有用的字段包括 incident_id、假名 account_id、计划或服务层、受控 impact_type、affected、impact_duration_ms、环境和 UTC 时间。
保留评估人口以及受影响人口。如果联接仅发现受影响的帐户,则所得百分比没有值得信赖的分母。避免在聚合表中出现客户名称、电子邮件、请求正文、支持消息和原始内容。将帐户级别的钻取限制为批准的响应者。
确定事件范围
客户影响 SQL 配方 按计划对评估和受影响的帐户进行计数,计算受影响的份额,并仅计算受影响行的平均持续时间。其固定装置显示三个受影响的企业帐户和两个受影响的启动帐户。
服务级别检测后使用查询:
- 验证事件的开始和影响的产品结果。
- 为同一完整窗口构建评估账户群体。
- 按计划、区域、路线或其他经过审查的有界维度比较影响。
- 将新受影响和已恢复的帐户作为单独的流量进行跟踪。
- 将查询、定义和结果保留在事件记录中。
如果没有批准的应对政策,请勿将更高的计划等同于更高的人类影响。计划是优先考虑因素之一,不能替代合同或安全要求。
验证恢复情况
恢复意味着客户可见的工作流程再次成功,并且延迟重试或作业已耗尽。仅回滚时间戳并不能证明。继续观察完整的存储桶并确保请求量没有消失。
incident_impact_observed 事件模式提供现场级起始合同。 事件响应指南 涵盖检测、路由和发布范围、时间表和恢复。 API 可靠性用例 提供了更广泛的测量策略,可以进行影响分析。