跳转到内容
Telemetry
浏览文档
指南更新于 2026年7月29日由 Telemetry 编辑团队和产品团队审核阅读约需 2 分钟

让编程智能体使用这篇文档

打开 Claude Code、Codex、Cursor 或其他编码代理的集中提示包,然后将其适应此处介绍的工作流程。

本页内容
  1. 定义一个影响行
  2. 确定事件范围
  3. 验证恢复情况

使用 SQL 进行客户影响分析

内部错误率并不能确定对客户的影响。事件响应需要记录产品结果:结帐失败、导出延迟、数据不可用或客户可能遇到的其他受控影响。

定义一个影响行

每个事件和批准的报告单元发出或派生一个有界行。有用的字段包括 incident_id、假名 account_id、计划或服务层、受控 impact_typeaffectedimpact_duration_ms、环境和 UTC 时间。

保留评估人口以及受影响人口。如果联接仅发现受影响的帐户,则所得百分比没有值得信赖的分母。避免在聚合表中出现客户名称、电子邮件、请求正文、支持消息和原始内容。将帐户级别的钻取限制为批准的响应者。

确定事件范围

客户影响 SQL 配方 按计划对评估和受影响的帐户进行计数,计算受影响的份额,并仅计算受影响行的平均持续时间。其固定装置显示三个受影响的企业帐户和两个受影响的启动帐户。

服务级别检测后使用查询:

  1. 验证事件的开始和影响的产品结果。
  2. 为同一完整窗口构建评估账户群体。
  3. 按计划、区域、路线或其他经过审查的有界维度比较影响。
  4. 将新受影响和已恢复的帐户作为单独的流量进行跟踪。
  5. 将查询、定义和结果保留在事件记录中。

如果没有批准的应对政策,请勿将更高的计划等同于更高的人类影响。计划是优先考虑因素之一,不能替代合同或安全要求。

验证恢复情况

恢复意味着客户可见的工作流程再次成功,并且延迟重试或作业已耗尽。仅回滚时间戳并不能证明。继续观察完整的存储桶并确保请求量没有消失。

incident_impact_observed 事件模式提供现场级起始合同。 事件响应指南 涵盖检测、路由和发布范围、时间表和恢复。 API 可靠性用例 提供了更广泛的测量策略,可以进行影响分析。

相关产品功能

对结构化事件表运行只读 DataFusion SQL 并重用结果。

内容责任与技术参考

Telemetry 编辑团队负责维护本文;产品团队审核功能行为、示例和适用范围。

查看编辑规范